规模无法克服语用学:报告偏差对视觉-语言推理的影响
计算与语言
2026-02-27 v1 计算机视觉与模式识别
摘要
视觉-语言模型(VLMs)的推理能力缺失仍处于研究讨论的前沿。我们认为,这种行为源于训练数据中的报告偏差。也就是说,人们在谈论视觉内容时默认会省略一些被动需求的隐含信息;例如,“at the game today!” 作为标题比“a photo of 37 people standing behind a field”更可能出现。我们从语用学理论的视角检视流行的 VLMs(包括 OpenCLIP、LLaVA-1.5 和 Molmo)所 underlying 的数据,并发现报告偏差导致四种推理技能(空间、时间、否定和计数)在训练数据中的表示不足,尽管这些语料规模为 web 规模或是人工合成生成。通过一组精选基准测试,我们展示:(i) VLMs 在上述因报告偏差被压抑的这几类推理技能上的表现较差;(ii) 与流行信念相反,扩大数据规模、模型规模以及多语言并不能默认实现这些技能的涌现;但值得欣慰的是,(iii) 纠正针对获取隐含信息的注释是有效的。我们的发现凸显了需要更有意识的训练数据策划方法,而不是仅仅依赖规模来实现推理能力的涌现的必要性。
引用
@article{arxiv.2602.23351,
title = {Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning},
author = {Amita Kamath and Jack Hessel and Khyathi Chandu and Jena D. Hwang and Kai-Wei Chang and Ranjay Krishna},
journal= {arXiv preprint arXiv:2602.23351},
year = {2026}
}
备注
TACL 2026