中文

通过建模 intra- 和 inter-modal 因果注意以解耦多模态情感分析中的偏差

机器学习 2026-05-21 v2

摘要

多模态情感分析 (MSA) 旨在通过整合来自文本、音频和视觉数据的多种信息来理解人类情绪。然而, 现有方法常受到模态内部和跨模态之间的伪相关影响, 导致模型依赖于统计捷径而非真实因果关系, 从而削弱了泛化能力。为缓解这一问题, 我们提出了多关系多模态因果干预 (MMCI) 框架, 利用因果理论中的背门调整方法来解决此类捷径的混淆效应。具体而言, 我们首先将多模态输入建模为多关系图, 以显式捕获 intra- 和 inter-modal 依赖。随后, 我们应用注意力机制分别估计并解耦这些 intra- 和 inter-modal 关系对应的因果特征和捷径特征。最后, 通过应用背门调整, 我们对捷径特征进行分层并动态地将其与因果特征组合, 以鼓励 MMCI 在分布迁移下产生稳定的预测。在多个标准 MSA 数据集和分布外 (OOD) 测试集上的大量实验表明, 我们的方法有效抑制了偏差并提升了性能。

关键词

引用

@article{arxiv.2508.04999,
  title  = {Disentangling Bias by Modeling Intra- and Inter-modal Causal Attention for Multimodal Sentiment Analysis},
  author = {Menghua Jiang and Yuxia Lin and Baoliang Chen and Haifeng Hu and Yuncheng Jiang and Sijie Mai},
  journal= {arXiv preprint arXiv:2508.04999},
  year   = {2026}
}

备注

Corrected several hyperparameter settings. Updated some experimental results