中文

面向语音情感识别的异构双模注意力融合

声音 2025-04-02 v3 人工智能 音频与语音处理

摘要

多模态情感识别在对话中的情感识别是一项具有挑战性的任务,由于不同模态之间存在复杂且互补的相互作用。音频和文本线索在从人类视角理解情绪方面尤为重要。大多数现有研究侧重于探索同一表示层次上音频与文本模态之间的相互作用。然而,一个关键问题常常被忽视:低层音频表示与高层文本表示之间的异构模态差距。为此,我们提出了一种名为异构双模注意力融合(Heterogeneous Bimodal Attention Fusion, HBAF)的新型框架,用于对话情感识别中的多层次多模态交互。该方法由三个关键模块组成:单模态表示模块、多模态融合模块和跨模态对比学习模块。单模态表示模块将语境内容整合到低层音频表示中,以弥合异构多模态差距,实现更有效的融合。多模态融合模块采用动态双模注意力和动态门控机制,以过滤错误的跨模态关系,充分挖掘内模态和跨模态之间的相互作用。最后,跨模态对比学习模块捕捉音频与文本模态之间复杂的绝对和相对相互作用。在MELD和IEMOCAP数据集上的实验表明,所提出的HBAF方法优于现有基于状态的学习方法。

关键词

引用

@article{arxiv.2503.06405,
  title  = {Heterogeneous bimodal attention fusion for speech emotion recognition},
  author = {Jiachen Luo and Huy Phan and Lin Wang and Joshua Reiss},
  journal= {arXiv preprint arXiv:2503.06405},
  year   = {2025}
}