通过建模 intra- 和 inter-modal 因果注意以解耦多模态情感分析中的偏差
机器学习
2026-05-21 v2
摘要
多模态情感分析 (MSA) 旨在通过整合来自文本、音频和视觉数据的多种信息来理解人类情绪。然而, 现有方法常受到模态内部和跨模态之间的伪相关影响, 导致模型依赖于统计捷径而非真实因果关系, 从而削弱了泛化能力。为缓解这一问题, 我们提出了多关系多模态因果干预 (MMCI) 框架, 利用因果理论中的背门调整方法来解决此类捷径的混淆效应。具体而言, 我们首先将多模态输入建模为多关系图, 以显式捕获 intra- 和 inter-modal 依赖。随后, 我们应用注意力机制分别估计并解耦这些 intra- 和 inter-modal 关系对应的因果特征和捷径特征。最后, 通过应用背门调整, 我们对捷径特征进行分层并动态地将其与因果特征组合, 以鼓励 MMCI 在分布迁移下产生稳定的预测。在多个标准 MSA 数据集和分布外 (OOD) 测试集上的大量实验表明, 我们的方法有效抑制了偏差并提升了性能。
引用
@article{arxiv.2508.04999,
title = {Disentangling Bias by Modeling Intra- and Inter-modal Causal Attention for Multimodal Sentiment Analysis},
author = {Menghua Jiang and Yuxia Lin and Baoliang Chen and Haifeng Hu and Yuncheng Jiang and Sijie Mai},
journal= {arXiv preprint arXiv:2508.04999},
year = {2026}
}
备注
Corrected several hyperparameter settings. Updated some experimental results