用于语音情感识别的双模态连接注意力融合
声音
2025-03-25 v3 人工智能
计算与语言
多媒体
音频与语音处理
摘要
由于难以提取捕捉细微情感差异的特征,多模态情感识别具有挑战性。理解多模态交互与连接是构建有效双模态语音情感识别系统的关键。本文提出双模态连接注意力融合(BCAF)方法,包含三个主要模块:交互连接网络、双模态注意力网络和相关注意力网络。交互连接网络采用编码器-解码器架构,在利用模态特定特征的同时对音频与文本之间的模态连接进行建模。双模态注意力网络增强语义互补并利用模态内与模态间交互。相关注意力网络降低跨模态噪声并捕捉音频与文本之间的相关性。在 MELD 和 IEMOCAP 数据集上的实验表明,所提出的 BCAF 方法优于现有的 SOTA 基线。
引用
@article{arxiv.2503.05858,
title = {Bimodal Connection Attention Fusion for Speech Emotion Recognition},
author = {Jiachen Luo and Huy Phan and Lin Wang and Joshua D. Reiss},
journal= {arXiv preprint arXiv:2503.05858},
year = {2025}
}