Méthodes

Apprendre une représentation multirésolution du signal

Du signal brut à l’analyse en ondelettes apprenable, au débruitage appris et à une représentation adaptée à la tâche.

Architecture SigWavNet : le signal traverse un bloc d’ondelettes apprenables ; chaque résolution passe par une convolution dilatée, une attention spatiale, un GRU bidirectionnel et une attention temporelle avant pondération et classification.
SigWavNet relie une décomposition en ondelettes apprise à un traitement neuronal multiéchelle.Alaa Nfissi and coauthors · sigwavnet

Planche de recherche

SigWavNet relie une décomposition en ondelettes apprise à un traitement neuronal multiéchelle.

Une transformée fixe encode des choix préalables sur la représentation du signal. Les recherches derrière SigWavNet et les modèles à paquets d’ondelettes étudient les éléments de l’analyse que l’on peut apprendre avec la tâche, tout en conservant une structure multirésolution.

La décomposition, le débruitage et le réseau en aval constituent des choix méthodologiques distincts. SigWavNet étudie une analyse en ondelettes apprenable ; les paquets d’ondelettes décomposent les branches d’approximation et de détail ; NWPA les emploie pour améliorer la parole. LFST prolonge cet axe par des superlettes fractionnaires et un encodeur spectrotemporel.

Suivre la méthode

Ouvrez chaque étape pour examiner les entrées, le travail effectué et les sorties décrites par les auteurs.

  1. 01 Représenter le signal à plusieurs échelles
    Entrée
    Signal vocal
    Sortie
    Coefficients multirésolutions

    Des bancs de filtres apprenables remplacent une analyse entièrement fixe. La décomposition sépare le contenu du signal selon plusieurs résolutions, pour exploiter des structures à différentes échelles temporelles et fréquentielles.

  2. 02 Apprendre quels coefficients conserver
    Entrée
    Signal décomposé
    Sortie
    Représentation apprise et débruitée

    Les études en ondelettes utilisent un seuillage apprenable pour atténuer des coefficients moins utiles. La fonction de seuillage dur asymétrique est entraînée avec le modèle, plutôt que choisie comme une règle indépendante de prétraitement.

  3. 03 Relier la représentation à la tâche
    Entrée
    Représentation apprise
    Sortie
    Prédiction émotionnelle ou parole améliorée

    Pour la reconnaissance émotionnelle, des composantes convolutives et récurrentes apprennent les structures spectrales et temporelles, avec attention dans les architectures concernées. Pour l’amélioration de la parole, l’autoencodeur bidirectionnel reconstruit le signal. Ces objectifs appellent des critères d’évaluation différents.

  4. 04 Examiner les résultats expérimentaux
    Entrée
    Modèle, données et protocole
    Sortie
    Résultats et limites propres à la tâche

    Lisez les jeux de données, partitions, métriques et ablations de chaque article avec ses résultats. Consultez l’implémentation associée pour la configuration correspondante ; les scores de classification émotionnelle et d’amélioration de la parole décrivent des tâches différentes.

Projets

  1. 01

    Projets

    Apprentissage temps-fréquence adaptatif

    Un dossier reliant ondelettes apprenables, paquets d’ondelettes, débruitage et superlettes fractionnaires.

Axes de recherche

  1. 01

    Programmes de recherche

    Représentations apprenables du signal

    Ondelettes, paquets d’ondelettes et superlettes fractionnaires : des représentations adaptatives pour l’analyse émotionnelle et l’amélioration de la parole.

Pour poursuivre la lecture

Se connecter pour enregistrer ce document →