中文

基于 Mamba 的音频基础模型最适合非言语情感识别吗?

音频与语音处理 2025-06-04 v1 声音

摘要

在这项工作中,我们关注非言语声音情感识别(NVER)。我们首次将基于 Mamba 的音频基础模型(MAFMs)应用于 NVER,并假设 MAFMs 将通过利用其状态空间建模更有效地捕捉内在情感结构,从而在 NVER 中优于基于注意力机制的音频基础模型。与可能因注意力机制而放大无关模式的 AAFMs 不同,MAFMs 将提取更稳定且具备上下文感知的表示,从而更好地区分微妙的非言语情感线索。我们使用最先进的 AAFMs 和 MAFMs 进行的实验验证了我们的假设。此外,受语音情感识别、合成语音检测等相关研究中基础模型融合展现出更优性能的启发,我们也探索了 NVER 中基础模型的融合。为此,我们提出了 RENO,它使用 Rényi 散度作为一种新型损失函数来实现基础模型的有效对齐。它还利用自注意力机制来实现基础模型间更好的内部表示交互。通过 RENO,借助 MAFMs 和 AAFMs 的异构融合,我们展示了相较于单个基础模型及其融合的最高性能,并且相较于此前最先进的工作创造了新的 SOTA。

关键词

引用

@article{arxiv.2506.02258,
  title  = {Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?},
  author = {Mohd Mujtaba Akhtar and Orchid Chetia Phukan and Girish and Swarup Ranjan Behera and Ananda Chandra Nayak and Sanjib Kumar Nayak and Arun Balaji Buduru and Rajesh Sharma},
  journal= {arXiv preprint arXiv:2506.02258},
  year   = {2025}
}

备注

Accepted to EUSIPCO 2025