中文

看、符号化、行动:基于空间表示的 VLMs 基地测试

人工智能 2026-03-30 v2

摘要

视觉语言模型 (VLM) 在描述视觉场景方面表现出色,但在将感知转化为精确、可 grounding 的动作方面困难重重。我们探讨了为何在交互式环境中提供 VLM 同时拥有视觉帧和场景的符号表示能提升其性能。我们在Atari游戏、VizDoom和AI2-THOR上评估了三个最先进的 VLM,比较了仅帧、帧加自提取符号、帧加 ground-truth 符号以及仅符号化管道。我们的结果表明,所有模型在符号信息准确时都能获益。然而,当 VLM 自行提取符号时,性能取决于模型能力和场景复杂度。我们进一步研究了 VLM 从视觉输入中提取符号信息的准确性,以及这些符号噪声对决策和游戏性能的影响。我们的发现揭示了,只有在符号提取可靠的前提下,符号化 grounding 才对 VLM 有益,并指出感知质量是未来 VLM-based agent 瓶颈。

关键词

引用

@article{arxiv.2603.11601,
  title  = {See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay},
  author = {Ashish Baghel and Paras Chopra},
  journal= {arXiv preprint arXiv:2603.11601},
  year   = {2026}
}

备注

11 pages, 13 figures. Accepted to LMReasoning Workshop at AAAI 2026