在合成空间关系数据上训练的CLIP风格视觉语言模型中的左右对称性破缺
计算机视觉与模式识别
2026-05-27 v2 人工智能
机器学习
摘要
空间理解仍然是视觉语言模型中的一个关键挑战。然而,这种理解是否真正被习得,如果是,通过何种机制习得,目前尚不清楚。我们提出了一个可控的一维图像-文本测试平台,以探究在使用CLIP风格对比目标训练的基于Transformer的视觉和文本编码器中,左右关系理解是如何涌现的。我们在单对象和双对象场景的配对描述上端到端地训练轻量级基于Transformer的视觉和文本编码器,并在系统性地改变标签和布局多样性的同时,评估对未见对象对的泛化能力。我们发现,对比训练能够学习左右关系,并且在此设置中,标签多样性(而非布局多样性)是泛化的主要驱动力。为获得机制性理解,我们进行了注意力分解,并表明位置嵌入和词元嵌入之间的相互作用诱导了一个水平注意力梯度,该梯度打破了编码器中的左右对称性;消融这一贡献会显著降低左右区分能力。我们的结果为CLIP风格模型何时以及如何获得关系能力提供了机制性见解。
引用
@article{arxiv.2601.12809,
title = {Left-Right Symmetry Breaking in CLIP-style Vision-Language Models Trained on Synthetic Spatial-Relation Data},
author = {Takaki Yamamoto and Chihiro Noguchi and Toshihiro Tanizawa},
journal= {arXiv preprint arXiv:2601.12809},
year = {2026}
}
备注
Accepted at ICML 2026