中文

心理导航:大型多模态语言模型能否进行心理导航?

人工智能 2026-03-24 v1

摘要

尽管多模态大语言模型(MLLM)在具身智能体中得到广泛应用,但其能力仍主要局限于基于即时观察的反应式规划,在广泛时空尺度的空间推理中持续失败。认知科学表明,生物智能(BI)依赖于“心理导航”:从经验中构建空间表征的策略性方法,以及在行动前进行心理路径模拟。为弥合AI与BI之间的差距,我们提出了Video2Mental,一种用于评估MLLM心理导航能力的首个基准测试。该任务要求从长时间的第三人称视频中构建层次化认知地图,并逐步生成基于地标的路径计划,通过仿真器验证规划精度。我们的基准测试结果表明,心理导航能力并非从标准预训练中自然涌现。前沿MLLM在零样本结构化空间表征方面困难重重,其规划精度随着时间跨度的延长而急剧衰减。为克服这一问题,我们提出了NavMind,一种利用显式细粒度认知地图作为可学习中间表征来内化心理导航的推理模型。通过难度分层的渐进式监督微调范式,NavMind有效地弥合了原始感知与结构化规划之间的差距。实验表明,NavMind在心理导航方面实现了卓越的能力,显著超越了前沿商业及空间MLLM。

关键词

引用

@article{arxiv.2603.21577,
  title  = {Mind over Space: Can Multimodal Large Language Models Mentally Navigate?},
  author = {Qihui Zhu and Shouwei Ruan and Xiao Yang and Hao Jiang and Yao Huang and Shiji Zhao and Hanwei Fan and Hang Su and Xingxing Wei},
  journal= {arXiv preprint arXiv:2603.21577},
  year   = {2026}
}