中文

WavFusion:面向 wav2vec 2.0 的多模态语音情感识别

声音 2024-12-10 v1 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

语音情感识别(SER)由于人类情感的内在复杂性和多样性,仍然是一项具有挑战性但至关重要的任务。为解决这一问题,研究人员尝试通过多模态学习融合来自其他模态的信息。然而,现有的多模态融合技术往往忽略跨模态交互的细微之处,导致次优的特征表示。在本文中,我们提出 WavFusion,一个多模态语音情感识别框架,旨在解决有效多模态融合、模态异质性和判别性表示学习等关键研究问题。通过利用门控跨模态注意力和多模态同质特征差异学习,WavFusion 在基准数据集上展示了优于现有最先进方法的性能。我们的工作强调了捕捉微妙的跨模态交互和学习判别性表示对于准确的多模态 SER 的重要性。在两个基准数据集(IEMOCAP 和 MELD)上的实验结果表明,WavFusion 在情感识别方面超越了最先进策略。

关键词

引用

@article{arxiv.2412.05558,
  title  = {WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition},
  author = {Feng Li and Jiusong Luo and Wanjun Xia},
  journal= {arXiv preprint arXiv:2412.05558},
  year   = {2024}
}

备注

Accepted by 31st International Conference on MultiMedia Modeling (MMM2025)