中文

关系图驱动的差分降噪与扩散注意力融合的多模态对话情感识别

计算与语言 2026-03-30 v1 声音 音频与语音处理

摘要

在真实场景中,音频和视频信号常受环境噪声和有限采集条件的影响,导致提取的特征包含过多噪声。此外,不同模态之间的数据质量和信息承载能力存在不平衡。这两个问题共同导致融合阶段的信息失真和权重偏差,损害整体识别性能。大多数现有方法忽视了噪声模态的影响,并依赖隐式加权来建模模态重要性,从而未能显式考虑文本模态在情感理解中的主导贡献。为解决这些问题,我们提出了一种面向多模态对话情感识别(MCER)的关系感知降噪与扩散注意力融合模型。具体而言,我们首先设计了一种差分Transformer,显式计算两个注意力图之间的差异,从而增强时间一致性信息并抑制时间无关噪声,实现音频和视频模态的有效降噪。其次,我们构建了模态特定和跨模态关系子图,以捕捉说话者依赖的情感依赖关系,实现对模态内和模态间关系的细粒度建模。最后,我们引入了一种文本引导的跨模态扩散机制,利用自注意力建模模态内依赖关系,并将视听信息自适应地扩散到文本流中,确保更鲁棒和语义对齐的多模态融合。

关键词

引用

@article{arxiv.2603.25752,
  title  = {Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition},
  author = {Ying Liu and Yuntao Shou and Wei Ai and Tao Meng and Keqin Li},
  journal= {arXiv preprint arXiv:2603.25752},
  year   = {2026}
}

备注

19 pages