中文

SigWavNet:学习用于语音情感识别的多分辨率信号小波网络

声音 2025-02-04 v1 人工智能 计算与语言 音频与语音处理

摘要

在人机交互和心理评估领域,语音情感识别(SER)在从语音信号中解读情感状态方面发挥着重要作用。尽管取得了进展,但由于系统复杂性、特征独特性问题以及噪声干扰,挑战依然存在。本文介绍了一种新的端到端(E2E)深度学习多分辨率框架用于SER,通过直接从原始波形语音信号中提取有意义的表示来解决这些局限性。通过利用快速离散小波变换(FDWT)的特性,包括级联算法、共轭正交滤波器和系数去噪,我们的方法通过深度学习技术为小波基和去噪引入了一个可学习的模型。该框架结合了一个激活函数,用于对小波系数进行可学习的非对称硬阈值处理。我们的方法利用了小波在时域和频域中有效定位的能力。然后,我们将一维扩张卷积神经网络(1D dilated CNN)与空间注意力层以及双向门控循环单元(Bi-GRU)与时间注意力层相结合,以高效捕捉情感特征的细微空间和时间特征。通过处理可变长度的语音而无需分割,并消除了预处理或后处理的需要,所提出的模型在IEMOCAP和EMO-DB数据集上优于最先进的方法。本文的源代码共享在Github仓库:https://github.com/alaaNfissi/SigWavNet-Learning-Multiresolution-Signal-Wavelet-Network-for-Speech-Emotion-Recognition。

关键词

引用

@article{arxiv.2502.00310,
  title  = {SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition},
  author = {Alaa Nfissi and Wassim Bouachir and Nizar Bouguila and Brian Mishara},
  journal= {arXiv preprint arXiv:2502.00310},
  year   = {2025}
}

备注

Published in: IEEE Transactions on Affective Computing