中文

从视觉语言模型中学习不变因果机制

计算机视觉与模式识别 2025-06-18 v4

摘要

对比语言-图像预训练(Contrastive Language-Image Pretraining, CLIP)取得了显著的成功,但在外分布(out-of-distribution, OOD)场景下微调时性能可能下降。我们使用结构因果模型(Structural Causal Model, SCM)来建模预测过程,展示了在训练环境中涉及不变因子和可变因子的因果机制,与测试环境中的因果机制不同。相比之下,仅包含不变因子的因果机制在不同环境中保持一致。我们在理论上证明了CLIP嵌入到不变因子之间的线性映射存在,该映射可使用干预数据估计。此外,我们提供了保证低OOD风险的条件。基于这些洞察,我们提出了CLIP的不变因果机制框架(CLIP-ICM)。CLIP-ICM涉及收集干预数据、估计线性投影矩阵,并在不变子空间内进行预测。在几个OOD数据集上的实验表明,CLIP-ICM显著提高了CLIP的性能。我们的方法提供了一种简单但强大的增强,提高了CLIP在实际应用中的可靠性。

关键词

引用

@article{arxiv.2405.15289,
  title  = {Learning Invariant Causal Mechanism from Vision-Language Models},
  author = {Zeen Song and Siyu Zhao and Xingyu Zhang and Jiangmeng Li and Changwen Zheng and Wenwen Qiang},
  journal= {arXiv preprint arXiv:2405.15289},
  year   = {2025}
}

备注

Accepted to ICML 2025