Publications / 2022
CNN-n-GRU: end-to-end speech emotion recognition from raw waveform signal using CNNs and gated recurrent unit networks
Résumé
CNN-n-GRU associe un réseau convolutif à n couches et un réseau d’unités récurrentes à portes à n couches pour reconnaître les émotions dans la parole. Au lieu d’utiliser des caractéristiques conçues manuellement ou des spectrogrammes, les couches convolutives apprennent les représentations du signal brut et les GRU en modélisent les dépendances temporelles. Cette combinaison vise à retenir les indices émotionnels acoustiques et leur évolution dans le temps. Le modèle est évalué sur TESS et comparé aux méthodes de référence. Les auteurs rapportent une précision supérieure à celle des approches de classification traditionnelles étudiées.
Citation et BibTeX
Alaa Nfissi, Wassim Bouachir, Nizar Bouguila, Brian L Mishara. (2022). CNN-n-GRU: end-to-end speech emotion recognition from raw waveform signal using CNNs and gated recurrent unit networks. 2022 21st IEEE International Conference on Machine Learning and Applications (ICMLA), 699–702. https://doi.org/10.1109/ICMLA55696.2022.00116
@inproceedings{nfissi-cnn-n-gru-2022,
title = {CNN-n-GRU: end-to-end speech emotion recognition from raw waveform signal using CNNs and gated recurrent unit networks},
author = {Nfissi, Alaa and Bouachir, Wassim and Bouguila, Nizar and Mishara, Brian L},
year = {2022},
booktitle = {2022 21st IEEE International Conference on Machine Learning and Applications (ICMLA)},
doi = {10.1109/ICMLA55696.2022.00116},
url = {https://doi.org/10.1109/ICMLA55696.2022.00116},
pages = {699--702}
}Projets de recherche
- 01
Projets
L’émotion à partir du signal brut
CNN-n-GRU et les études associées relient les motifs acoustiques locaux aux dépendances temporelles.
Axes de recherche
- 01
Programmes de recherche
Parole, émotion et contexte humain
Apprendre à partir de la parole en tenant compte de la personne, des conditions d’enregistrement et des limites de l’interprétation.
Code
- 01