中文

更多不一定更好:视觉空间推理中空间信息与常识信息系统性分析

计算与语言 2026-02-26 v1

摘要

视觉空间推理(VSR)尽管在多模态架构取得进展,仍然是现代视觉语言模型(VLM)面临的挑战。常见的策略是在推理时注入额外信息,包括显式空间线索、外部常识知识或链式思考(CoT)推理指令。然而,何时这些信息真正改善推理,何时引入噪声,仍不明确。本文我们对信息注入在VSR中的效果进行假设驱动的分析,涉及三个代表性VLM和两个公开基准。我们检讨(i)空间语境的类型与数量,(ii)注入常识知识的多少与相关性,以及(iii)空间定位与CoT提示之间的相互作用。我们的结果揭示了一个一致模式:更多信息并不一定导致更好的推理。针对性的单一空间线索优于多语境聚合,过量或相关性弱的常识知识会降低性能,只有在空间定位足够精确时,CoT提示才会提升准确率。这一发现凸显了选择性、任务对齐信息注入的重要性,并为设计可靠的多模态推理管道提供了实用指导。

关键词

引用

@article{arxiv.2602.21619,
  title  = {When More Is Less: A Systematic Analysis of Spatial and Commonsense Information for Visual Spatial Reasoning},
  author = {Muku Akasaka and Soyeon Caren Han},
  journal= {arXiv preprint arXiv:2602.21619},
  year   = {2026}
}

备注

5 pages, 6 figures, Under review