中文

多模态表征学习因果完整原因探究

机器学习 2025-05-27 v6

摘要

多模态学习 (MML) 旨在学习跨模态的有效表征,以实现准确预测。现有方法通常侧重于模态的一致性和特异性,以学习有效的表征。然而,从因果视角来看,这些方法可能导致表征中包含不足或不必要的信息。为此,我们提出有效的 MML 表征应具有因果充分性和必要性。考虑到现实中的仪变量相关性和模态冲突,我们放宽了先前研究中常见的独立性和单调性假设,探讨针对 MML 特有的概念,即因果完整原因 C3C^3。我们首先定义 C3C^3,以量化表征在因果充分性和必要性方面的概率。随后,我们讨论 C3C^3 的可识别性,并引入仪变量以支持在非独立性和非单调性下识别 C3C^3。在此基础上,我们进行 C3C^3 测量,即 C3C^3 风险。我们提出双网络通过 (i) 真实世界分支:利用仪变量实现充分性,和 (ii) 假设世界分支:应用基于梯度的反事实建模实现必要性来估计 C3C^3。理论分析确认其可靠性。基于这些结果,我们提出 C3C^3 正则化,一种即插即用的方法,通过最小化 C3C^3 风险来强制学习到的表征具有因果完整性。广泛的实验表明其有效性。

关键词

引用

@article{arxiv.2407.14058,
  title  = {Towards the Causal Complete Cause of Multi-Modal Representation Learning},
  author = {Jingyao Wang and Siyu Zhao and Wenwen Qiang and Jiangmeng Li and Changwen Zheng and Fuchun Sun and Hui Xiong},
  journal= {arXiv preprint arXiv:2407.14058},
  year   = {2025}
}