GRETSI'03 -- Proceedings

	19^st GRETSI Symposium on Signal and Image Processing Paris 8 - 11 september 2003

Information related to the paper

Title

Détection de la parole et de la musique : fusion de deux approches

Author(s)

Julien Pinquier	IRIT
Jean-Luc Rouas	IRIT
Julie Mauclair	IRIT
Régine André-Obrecht	IRIT

Rererences

vol. III, page 78

Get the paper in PDF format

To obtain Acrobat Reader (version 5 minimum required) necessary to his read.

Abstract

Dans cet article, une segmentation de la bande sonore est effectuée en détectant les composantes parole et musique. Cette segmentation résulte de la fusion de deux approches de classification. La première, classique, est basée sur une analyse spectrale et des Modèles de Mélanges de Gaussiennes (MMG). La seconde, originale, utilise des paramètres "simples" et robustes : la modulation de l'énergie à quatre hertz, la modulation de l'entropie, la durée des segments (issus d'une segmentation automatique) et le nombre de ces segments par seconde. Notre système global se décompose en deux sous-systèmes de classification (Parole/NonParole et Musique/NonMusique). Il atteint respectivement 94% d'accuracy pour la parole et 90% pour la musique sachant qu'une décision est prise sur chaque seconde du signal. Il apparaît très intéressant d'améliorer un système classique, basé sur une analyse spectrale et des MMG, par des paramètres "simples" et robustes.

Edition : Télécom-Paris -- 2003