中文

对婴儿规模视觉语言模型中属性歧视的基准测试

机器学习 2026-05-14 v3

摘要

婴儿不仅学习物体类别,还从有限经验中学习细粒度视觉属性,如颜色、大小和纹理。先前的婴儿规模视觉-语言模型主要在物体识别上进行评估,留下了它们是否支持类内属性歧视的问题。我们引入了一个受控基准测试,通过合成渲染在 67 种日常物体类别上变化颜色、大小和纹理,以解耦属性值与物体身份。我们评估了婴儿训练模型 (CVCL 和婴儿训练 DINO 基线) 与 web 规模和 ImageNet 模型 (CLIP、SigLIP、ResNeXt) 的两种互补设置:一种是仅图像的 prototype 测试,另一种是带有属性-物体提示的文本-视觉测试。我们发现视觉和语言属性信息存在异构:婴儿训练模型在大小和纹理上形成强大的视觉表征并在纹理方面表现良好,但在视觉颜色歧视方面表现不佳;在文本-视觉设置中它们在颜色 grounding 方面困难,仅在大小 grounding 上表现出适度。相比之下,web 训练的视觉-语言模型在文本中强力 grounding 颜色,同时在视觉大小歧视方面表现较弱。

关键词

引用

@article{arxiv.2512.18951,
  title  = {Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models},
  author = {Patrick Batsell and Satoshi Tsutsui and Bihan Wen},
  journal= {arXiv preprint arXiv:2512.18951},
  year   = {2026}
}