视觉语言模型在测试时计算是否存在反比例缩放?一种基于干扰项的实证分析
计算机视觉与模式识别
2025-11-27 v1 人工智能
计算与语言
机器学习
摘要
无关信息(即干扰项)如何影响视觉语言模型(VLMs)的测试时缩放?先前的语言模型研究报告了反比例缩放效应,即文本干扰项导致推理过程更长但更不有效。为探讨类似现象是否在多模态环境中存在,我们引入 Idis(Images with distractors),这是一个系统性变更干扰项在语义、数值和空间维度上的视觉问答数据集。我们的分析揭示,视觉干扰项与文本干扰项根本不同:尽管反比例缩放效应仍然存在,但添加视觉干扰项会降低准确率而不增加推理长度。我们进一步表明,跟踪推理痕迹中属性的计数提供了关键见解,揭示了干扰项、推理长度与准确率之间的相互作用。最后,我们证明这些趋势也适用于诸如 Waterbirds 等已建立的视觉偏置基准测试,我们提出一种简单的方法来缓解推理模型中的偏置驱动预测。
引用
@article{arxiv.2511.21397,
title = {Do Reasoning Vision-Language Models Inversely Scale in Test-Time Compute? A Distractor-centric Empirical Analysis},
author = {Jiyun Bae and Hyunjong Ok and Sangwoo Mo and Jaeho Lee},
journal= {arXiv preprint arXiv:2511.21397},
year = {2025}
}
备注
preprint