中文

忽视位置,偏离语言:探究视觉语言编码器中层表征偏差对零样本语言导向空间理解的影响

计算机视觉与模式识别 2026-03-20 v2 人工智能

摘要

视觉语言编码器(VLEs)广泛用作零样本指代图像分割(RIS)的 backbone,使其能够在无需任务特定训练的情况下实现文本导向的局部分割。然而,先前的工作未充分探讨维持位置和语言特定信息的中层表征中潜在的偏差。通过逐层分析,我们发现常用的最终层多模态嵌入侧重于全局语义对齐,导致两个相互关联的后果。其一,视觉嵌入对位置线索的敏感性较弱。其二,多语言文本嵌入在共享空间中形成语言依赖的几何偏移。鼓励这些发现,我们在 VLE 中层识别出一种尚未被充分探索的构建空间图的途径,可用于通过 1-7 mIoU 提升九个 RefCOCO 数据集上的零样本 RIS。此外,利用混合语言中层嵌入可实现更高的空间定位准确率(+7-8 mIoU 和 IoU@50),尽管推理成本增加,也在零样本文本到图像检索任务中取得改进。我们的工作开启了对 VLEs 有效表征偏差探针化对增强空间定位的讨论大门。

关键词

引用

@article{arxiv.2509.23098,
  title  = {Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding},
  author = {Na Min An and Inha Kang and Minhyun Lee and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2509.23098},
  year   = {2026}
}

备注

61 pages, 28 Figures, 15 Tables