GRETSI'03 -- Actes du Colloque

	19^e Colloque GRETSI sur le traitement du signal et des images Paris 8 - 11 septembre 2003

Informations concernant l'article

Titre

Détection de la parole et de la musique : fusion de deux approches

Auteur(s)

Julien Pinquier	IRIT
Jean-Luc Rouas	IRIT
Julie Mauclair	IRIT
Régine André-Obrecht	IRIT

Références

vol. III, page 78

L'article au format PDF

Pour obtenir Acrobat Reader (version 5 minimum recommandée) nécessaire pour sa lecture.

Résumé

Dans cet article, une segmentation de la bande sonore est effectuée en détectant les composantes parole et musique. Cette segmentation résulte de la fusion de deux approches de classification. La première, classique, est basée sur une analyse spectrale et des Modèles de Mélanges de Gaussiennes (MMG). La seconde, originale, utilise des paramètres "simples" et robustes : la modulation de l'énergie à quatre hertz, la modulation de l'entropie, la durée des segments (issus d'une segmentation automatique) et le nombre de ces segments par seconde. Notre système global se décompose en deux sous-systèmes de classification (Parole/NonParole et Musique/NonMusique). Il atteint respectivement 94% d'accuracy pour la parole et 90% pour la musique sachant qu'une décision est prise sur chaque seconde du signal. Il apparaît très intéressant d'améliorer un système classique, basé sur une analyse spectrale et des MMG, par des paramètres "simples" et robustes.

Edition : Télécom-Paris -- 2003