Publications / 2025
Multimodal Emotion Recognition with Cross-Attentive Learning and Feature Fusion
Résumé
Cette étude propose une méthode de reconnaissance émotionnelle multimodale qui affine la fusion des caractéristiques par attention croisée. Des modèles adaptés à chaque source traitent l’audio, le texte et la vidéo, puis apprennent les dépendances entre modalités. Une fonction de perte focale prend en compte le déséquilibre des classes. L’évaluation sur IEMOCAP rapporte une précision moyenne de 88,31 % et un score F1 de 76,43 %, supérieurs aux méthodes comparées dans l’étude. Le code associé est publié dans le dépôt Mental-Health-Monitoring-MMER.
Citation et BibTeX
Alaa Nfissi, Ines Jemmali, Wassim Bouachir, Nizar Bouguila. (2025). Multimodal Emotion Recognition with Cross-Attentive Learning and Feature Fusion. Canadian Conference on Artificial Intelligence (Canadian AI). https://doi.org/10.21428/594757db.4bf551e5
@inproceedings{nfissi-cross-attentive-multimodal-emotion-2025,
title = {Multimodal Emotion Recognition with Cross-Attentive Learning and Feature Fusion},
author = {Nfissi, Alaa and Jemmali, Ines and Bouachir, Wassim and Bouguila, Nizar},
year = {2025},
booktitle = {Canadian Conference on Artificial Intelligence (Canadian AI)},
doi = {10.21428/594757db.4bf551e5},
url = {https://doi.org/10.21428/594757db.4bf551e5}
}Projets de recherche
- 01
Projets
Fusion émotionnelle par attention croisée
Étudier les relations entre audio, texte et vidéo par attention croisée et fusion des caractéristiques.
Axes de recherche
- 01
Programmes de recherche
Apprentissage interprétable et multimodal
Comprendre les caractéristiques acoustiques et étudier l’interaction de la voix, du langage et des indices visuels dans la reconnaissance des émotions.
Code
- 01
Dépôts de code
Cross-attentive multimodal emotion recognition
Code de recherche associé au dossier « Fusion émotionnelle par attention croisée ».