中文

文本与图像表示从第一层开始对齐

计算机视觉与模式识别 2026-01-14 v1 人工智能

摘要

我们表明,对于适配器式视觉语言模型中的各种概念,其图像表示与文本描述表示从第一层就呈现了有意义的对齐。这与该行业已认知的观点相矛盾,即此类图像-文本对齐仅在后期层中才会出现。我们采用一种受深度梦境(DeepDream)启发的新型合成方法来验证这一点:给定文本概念(如“木星”),我们提取该概念在特定层的概念向量,然后通过优化方法合成与该向量对齐的图像。我们将该方法应用于Gemma 3中的七个层的数百个概念,发现所合成的图像常常描绘了目标文本概念的显著视觉特征:例如,在第一层,超过50%的图像描绘了动物、活动或季节等可识别特征。因此,我们的方法提供了对图像-文本在概念层面和逐层层面对齐的直接、建设性证据。不同于以往衡量多模态对齐的方法,本方法简单、快速,且无需额外模型或数据集。它还为模型可解释性提供了新路径,通过反向追踪图像处理组件来可视化模型表示空间。

关键词

引用

@article{arxiv.2601.08017,
  title  = {Representations of Text and Images Align From Layer One},
  author = {Evžen Wybitul and Javier Rando and Florian Tramèr and Stanislav Fort},
  journal= {arXiv preprint arXiv:2601.08017},
  year   = {2026}
}