Publications / 2026
Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition
Résumé
LFST apprend une représentation temps-fréquence conjointement à une tâche de reconnaissance émotionnelle. À partir d’ondelettes de Morlet corrigées en composante continue, la méthode combine les réponses par moyenne géométrique pondérée et apprend les poids d’ordres fractionnaires, une grille logarithmique monotone de fréquences et des nombres de cycles dépendant de la fréquence. Un seuillage dur asymétrique apprenable produit des activations clairsemées et débruitées. Un encodeur émotionnel spectrotemporel compact (STEE) traite les canaux d’amplitude et de congruence de phase par blocs multiéchelles, modulation FiLM adaptative, attention axiale et agrégation attentive. L’étude évalue le système sur IEMOCAP, EMO-DB et le corpus privé NSPL-CRISE ; les ablations portent notamment sur les grilles de fréquences, les cycles et les ordres fractionnaires. L’analyse mathématique examine l’admissibilité, la continuité, l’analyticité approchée et des conditions de bornitude et de stabilité. L’encodeur compact réduit les besoins en paramètres par rapport aux grands modèles autosupervisés, au prix d’un calcul supplémentaire dans l’analyse initiale par rapport aux bases STFT et LEAF.
La contribution centrale consiste à rendre l’analyse temps-fréquence adaptative en conservant sa structure mathématique. Les ordres fractionnaires sont représentés par des mélanges normalisés d’ordres discrets, ce qui permet à la représentation d’évoluer continûment pendant l’entraînement de bout en bout.
STEE exploite l’amplitude et la congruence de phase. Son architecture combine traitement temporel résiduel et fréquentiel séparable avec modulation FiLM adaptative et autoattention sur l’axe temporel. Une perte focale et un rééquilibrage facultatif des classes accompagnent la classification émotionnelle.
L’article et l’implémentation publique fournissent le protocole expérimental et les configurations. NSPL-CRISE est un corpus de recherche privé ; la disponibilité du dépôt ne rend pas ces enregistrements publics.

Citation et BibTeX
Alaa Nfissi, Wassim Bouachir, Nizar Bouguila, Brian L. Mishara. (2026). Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition. ICLR. https://proceedings.iclr.cc/paper_files/paper/2026/hash/b2fb36504c53a6e55f0bcc6951c472cb-Abstract-Conference.html
@inproceedings{nfissi-lfst-2026,
title = {Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition},
author = {Nfissi, Alaa and Bouachir, Wassim and Bouguila, Nizar and Mishara, Brian L.},
year = {2026},
booktitle = {International Conference on Learning Representations},
url = {https://proceedings.iclr.cc/paper_files/paper/2026/hash/b2fb36504c53a6e55f0bcc6951c472cb-Abstract-Conference.html}
}Projets de recherche
- 01
Projets
Apprentissage temps-fréquence adaptatif
Un dossier reliant ondelettes apprenables, paquets d’ondelettes, débruitage et superlettes fractionnaires.
Axes de recherche
- 01
Programmes de recherche
Représentations apprenables du signal
Ondelettes, paquets d’ondelettes et superlettes fractionnaires : des représentations adaptatives pour l’analyse émotionnelle et l’amélioration de la parole.
Code
- 01
Dépôts de code
LFST for speech emotion recognition
Code de recherche associé au dossier « Apprentissage temps-fréquence adaptatif ».