中文

用于语音情感识别的双模态连接注意力融合

声音 2025-03-25 v3 人工智能 计算与语言 多媒体 音频与语音处理

摘要

由于难以提取捕捉细微情感差异的特征,多模态情感识别具有挑战性。理解多模态交互与连接是构建有效双模态语音情感识别系统的关键。本文提出双模态连接注意力融合(BCAF)方法,包含三个主要模块:交互连接网络、双模态注意力网络和相关注意力网络。交互连接网络采用编码器-解码器架构,在利用模态特定特征的同时对音频与文本之间的模态连接进行建模。双模态注意力网络增强语义互补并利用模态内与模态间交互。相关注意力网络降低跨模态噪声并捕捉音频与文本之间的相关性。在 MELD 和 IEMOCAP 数据集上的实验表明,所提出的 BCAF 方法优于现有的 SOTA 基线。

关键词

引用

@article{arxiv.2503.05858,
  title  = {Bimodal Connection Attention Fusion for Speech Emotion Recognition},
  author = {Jiachen Luo and Huy Phan and Lin Wang and Joshua D. Reiss},
  journal= {arXiv preprint arXiv:2503.05858},
  year   = {2025}
}