中文

面向跨情景多模态情感识别的双分支图域适应框架

音频与语音处理 2026-03-31 v1 人工智能

摘要

多模态情感识别在对话中(MERC)旨在通过文本、音频和视觉线索预测说话者的情感状态。在真实场景中,对话的情景在说话者、主题、风格和噪声水平上差异显著。现有 MERC 方法通常忽略这些跨情景变异,限制了在未知目标域对训练源域模型的迁移能力。为此,我们提出面向跨情景多模态情感识别的双分支图域适应框架(DGDA)。首先构建情感互动图,以刻画 utterance 之间复杂的情感依赖。随后设计包含超图神经网络(HGNN)和路径神经网络(PathNN)的双分支编码器,显式建模多变量关系,隐式捕获全局依赖。为实现跨域泛化,引入域对抗判别器以学习跨域不变表示。此外,融入正则化损失以抑制噪声标签的负面影响。到目前为止,DGDA 是首个同时处理域迁移与标签噪声的 MERC 框架。理论分析给出更紧致的泛化界,大量实验在 IEMOCAP 和 MELD 上表明 DGDA 在跨情景对话中持续优于强基线,适应性更强。我们的代码已公开于 https://github.com/Xudmm1239439/DGDA-Net。

关键词

引用

@article{arxiv.2603.26840,
  title  = {Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition},
  author = {Yuntao Shou and Jun Zhou and Tao Meng and Wei Ai and Keqin Li},
  journal= {arXiv preprint arXiv:2603.26840},
  year   = {2026}
}

备注

29 pages