中文

CitySeeker:视觉语言模型如何探索带隐式人类需求的具身城市导航

人工智能 2025-12-19 v1

摘要

视觉语言模型(VLMs)在显式指令驱动的导航任务中取得了显著进展;然而,其在动态城市环境中解读隐式人类需求(例如“我渴了”)的能力仍受到 insufficient 探索。本文引入 CitySeeker,一套新型基准测试,旨在评估 VLMs 的空间推理与决策能力,以满足具身城市导航中的隐式需求。CitySeeker 包含 8 个城市的 6,440 条轨迹,涵盖多样的视觉特征与 7 种目标驱动情景中的隐式需求。大量实验表明,即便是表现最佳的模型(如 Qwen2.5-VL-32B-Instruct)也仅实现 21.1% 的任务完成率。我们发现关键瓶颈在于长程推理中的误差累积、空间认知不足以及经验记忆缺失。为进一步分析这些问题,我们探究了一系列探索性策略——回溯机制、丰富空间认知与记忆驱动检索(BCR),灵感来自人类认知映射对迭代观察-推理循环和自适应路径优化的重视。我们的分析为开发具备稳健空间智能的 VLMs 提供了可操作的见解,以应对“最后一英里”导航挑战。

关键词

引用

@article{arxiv.2512.16755,
  title  = {CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?},
  author = {Siqi Wang and Chao Liang and Yunfan Gao and Erxin Yu and Sen Li and Yushi Li and Jing Li and Haofen Wang},
  journal= {arXiv preprint arXiv:2512.16755},
  year   = {2025}
}