视觉语言模型追踪而不跟踪:诊断视觉路径跟随中的失败
计算机视觉与模式识别
2026-05-18 v1 人工智能
摘要
视觉语言模型(VLMs)在多模态基准测试上取得了强大的性能,但可能仍然缺乏对基本视觉操作的鲁棒控制。我们研究“线条追踪”,即模型必须通过连续的局部延续来跟随一条选定的视觉路径。为了隔离这种能力,我们设计了受控的追踪任务,这些任务引入了附近的竞争者,同时减少了语义和拓扑上的歧义,例如交叉和重叠。在这些任务中,即使是当前最先进的 VLMs 也经常丢失目标路径并切换到附近的替代路径,尤其是当这些替代路径在局部看起来与目标相似时。行为干预和内部分析表明,这些失败源于局部竞争:附近相似的干扰项将模型从真正的延续中拉开。标准补救措施无法消除这一瓶颈:模型规模扩展仅提供有限的增益,推理通过代价高昂的替代策略部分补偿,而明确的追踪指令未能恢复稳定的路径跟随。最后,对具有更丰富视觉复杂性的缠绕电缆场景和地铁地图的测试表明,相同的路径切换失败在我们的受控设置之外仍然存在。
引用
@article{arxiv.2605.15672,
title = {VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following},
author = {Hyesoo Hong and Minsoo Kim and Wonje Jeung and Sangyeon Yoon and Dongjae Jeon and Albert No},
journal= {arXiv preprint arXiv:2605.15672},
year = {2026}
}