GRETSI'03 19e Colloque GRETSI
sur le traitement du signal et des images

Paris   8 - 11 septembre 2003

Accueil Programme Par session Par auteur Par thème Par code

Informations concernant l'article

Titre
Détection de la parole et de la musique : fusion de deux approches
Auteur(s)
Julien Pinquier IRIT
Jean-Luc Rouas IRIT
Julie Mauclair IRIT
Régine André-Obrecht IRIT
Références
vol. III, page 78
L'article au format PDF
 
Pour obtenir Acrobat Reader (version 5 minimum recommandée) nécessaire pour sa lecture.

Résumé

Dans cet article, une segmentation de la bande sonore est effectuée en détectant les composantes parole et musique. Cette segmentation résulte de la fusion de deux approches de classification. La première, classique, est basée sur une analyse spectrale et des Modèles de Mélanges de Gaussiennes (MMG). La seconde, originale, utilise des paramètres "simples" et robustes : la modulation de l'énergie à quatre hertz, la modulation de l'entropie, la durée des segments (issus d'une segmentation automatique) et le nombre de ces segments par seconde. Notre système global se décompose en deux sous-systèmes de classification (Parole/NonParole et Musique/NonMusique). Il atteint respectivement 94% d'accuracy pour la parole et 90% pour la musique sachant qu'une décision est prise sur chaque seconde du signal. Il apparaît très intéressant d'améliorer un système classique, basé sur une analyse spectrale et des MMG, par des paramètres "simples" et robustes.

Edition : Télécom-Paris -- 2003