中文

LLM 与 VLM 如何在没有视觉信息的情况下理解视图旋转?一项解释性研究

人工智能 2026-04-17 v1

摘要

过去一年,空间智能越来越受到关注。许多先前的工作从视觉-空间智能的角度进行研究,其中模型能够获取来自视觉输入的视觉-空间信息。然而,在缺乏视觉信息的情况下,语言智能是否足以赋予模型空间智能,以及模型如何仅使用文本输入完成相关任务仍未探索。因此,本文聚焦于从语言视角研究一种基础且关键的空间智能能力:视图旋转理解 (VRU)。具体而言,询问 LLM 和 VLM 根据视图旋转和观察的文本描述推断其最终视图并预测对应环境的观察。我们发现,尽管人类可以轻松实现 100% 的准确率,但 LLM 和 VLM 在我们提出的数据集上表现较差,这表明当前模型能力与空间智能要求之间存在显着差距。为揭示背后的机制,我们进行了逐层探测分析和逐头因果干预。我们的发现表明,尽管模型在隐藏状态中编码视图信息,但它们似乎在将视图位置与相应观察绑定方面存在困难,导致最终层出现幻觉。最后,我们对由因果干预识别的关键注意力头进行有选择的微调,以提高 VRU 性能。实验结果表明,这种有选择的微调在提高 VRU 性能方面取得了改进,同时避免了对通用能力的灾难性遗忘。我们的数据集和代码将在 https://github.com/Young-Zhen/VRU_Interpret 上发布。

关键词

引用

@article{arxiv.2604.15294,
  title  = {How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study},
  author = {Zhen Yang and Ping Jian and Zhongbin Guo and Zuming Zhang and Chengzhi Li and Yonghong Deng and Xinyue Zhang and Wenpeng Lu},
  journal= {arXiv preprint arXiv:2604.15294},
  year   = {2026}
}

备注

Published as a main-conference paper at The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)