中文

从令牌级因果视角理解视觉语言组合性的困难性

机器学习 2025-10-31 v1 人工智能

摘要

对比式语言-图像预训练 (CLIP) 通过在共享嵌入空间中对齐图像和文本,实现了强大的跨模态泛化,但在对对象、属性和关系的组合推理时始终无法做到,常常表现得像基于词项的匹配器。先前的因果解释通常将文本建模为单个向量,掩盖了令牌级结构,导致对提示敏感性和对硬负例失败的解释仍不充分。我们通过基于顺序语言令牌因果图 (SCM) 的令牌感知因果表示学习 (CRL) 框架来弥补这一差距。我们的理论将块可识别性扩展到令牌化文本,证明 CLIP 的对比目标可在句子级和令牌级 SCM 下恢复模态不变潜变量。关键在于令牌粒度,首次从原则上解释了 CLIP 的组合脆弱性:组合不可识别性。我们展示了存在伪最优文本编码器,能够实现完美的模态不变对齐,却对原子概念上的置换 (SWAP)、替换 (REPLACE) 和添加 (ADD) 操作感知不敏感,从而无法区分正确描述和硬负例,尽管它们与真正最优编码器优化的是相同的训练目标。进一步分析通过模态间隙将语言侧的不可识别性链接到视觉侧的失败,并展示了迭代组合算子如何加剧难度,从而激励改进的负采样策略。

关键词

引用

@article{arxiv.2510.26302,
  title  = {Understanding Hardness of Vision-Language Compositionality from A Token-level Causal Lens},
  author = {Ziliang Chen and Tianang Xiao and Jusheng Zhang and Yongsen Zheng and Xipeng Chen},
  journal= {arXiv preprint arXiv:2510.26302},
  year   = {2025}
}