中文

同类之鸟聚集:通过视觉-语言模型中的线性结构实现背景不变表示

计算机视觉与模式识别 2026-05-13 v1 人工智能

摘要

视觉-语言模型(VLMs),如 CLIP 和 SigLIP 2,广泛用于图像分类,但其视觉编码器仍然容易受到系统性偏差的威胁,削弱了鲁棒性。特别是前景物体与其背景之间的相关性构成了一个突出且在实际中重要的偶然依赖类。在本工作中,我们重新审视了 VLM 嵌入空间中高线性可加性的已知属性,并展示了它使场景表示可分解为前景和背景组件。借助这一洞见,我们引入了一个预训练方法,利用该属性通过合成数据构建背景不变表示。我们的方法据称实现了在水鸟数据集上实现超过 90%90\% 的最差群体准确率(在完美(100%100\%)的偶然相关条件下),并且演示了强大的仿真到现实迁移能力,无需访问真实世界去偏迁移数据,使其在实际部署中具有实用性。

关键词

引用

@article{arxiv.2605.11107,
  title  = {Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs},
  author = {Youssef Zaazou and Mark Thomas},
  journal= {arXiv preprint arXiv:2605.11107},
  year   = {2026}
}

备注

36 pages, 7 figures