中文

从对应关系到动作:多模态大语言模型中类人的多图像空间推理

计算机视觉与模式识别 2026-02-11 v2

摘要

尽管多模态大语言模型(MLLMs)在单图像空间推理方面取得了显著进展,但需要整合来自多个视角信息的多图像空间推理仍然具有挑战性。认知研究表明,人类通过两种机制处理此类任务:跨视图对应关系,即识别不同视图中对应于相同物理位置的区域;以及逐步视点变换,即顺序组合相对视点变化。然而,现有研究仅部分且通常隐式地整合了这些机制,没有对两者进行显式监督。我们提出用于跨视图对应关系和视点变化的人类感知训练(HATCH),这是一个具有两个互补目标的训练框架:(1) 补丁级空间对齐,鼓励补丁表示在空间对应区域跨视图对齐;以及 (2) 动作后回答推理,要求模型在预测最终答案之前生成显式的视点转换动作。在三个基准上的实验表明,HATCH在清晰的优势上持续优于同等规模的基线,并在与更大模型的竞争中取得了有竞争力的结果,同时保持了单图像推理能力。

关键词

引用

@article{arxiv.2602.08735,
  title  = {From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models},
  author = {Masanari Oi and Koki Maeda and Ryuto Koike and Daisuke Oba and Nakamasa Inoue and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2602.08735},
  year   = {2026}
}