时频状态空间二元性:面向语音情感识别的高效范式
声音
2024-12-24 v1 音频与语音处理
摘要
语音情感识别 (SER) 在增强人机交互的用户体验方面发挥着关键作用。然而,现有方法过于依赖时域分析,忽视了频域 envelope 结构在鲁健情感识别中同样重要的价值。为克服这一局限,我们提出 TF-Mamba,一个新型多域框架,捕获时空维度中的情感表达。具体而言,我们提出时频 mamba 块以提取时-频感知情感特征,实现计算效率与模型表达性间的最佳平衡。此外,我们设计复数度量-距离三元组 (CMDT) loss 以使模型能够捕获 SER 的代表性情感线索。大量实验在 IEMOCAP 和 MELD 数据集上表明,TF-Mamba 在模型规模和延迟方面超越了现有方法,为未来 SER 应用提供了更实用的解决方案。
引用
@article{arxiv.2412.16904,
title = {Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition},
author = {Jiaqi Zhao and Fei Wang and Kun Li and Yanyan Wei and Shengeng Tang and Shu Zhao and Xiao Sun},
journal= {arXiv preprint arXiv:2412.16904},
year = {2024}
}
备注
Accepted by ICASSP 2025