中文

野外城市导航:探索MLLM中来自网络规模知识的涌现导航

计算机视觉与模式识别 2026-02-12 v3

摘要

利用多模态大语言模型(MLLM)开发具身智能体为解决复杂的现实世界任务提供了巨大前景。然而,当前的评估基准仍然主要侧重于语言或严重依赖模拟环境,很少探究对实际、现实世界场景至关重要的细微的、知识密集型推理能力。为弥合这一关键差距,我们引入了稀疏接地视觉导航任务,专门设计用于评估MLLM在具有挑战性的、知识密集型现实世界环境中的序贯决策能力。我们通过CityNav来实现这一任务,这是一个全面的基准,涵盖四个不同的全球城市,专门构建用于评估原始MLLM驱动的智能体在城市导航中的表现。智能体仅依赖视觉输入和内部多模态推理,在没有任何额外环境注释或专门架构修改的情况下依次导航50多个决策点。关键的是,智能体必须通过解读城市特定线索和识别地标来实现自主定位,执行空间推理,并策略性地规划和执行到达目的地的路线。通过广泛评估,我们证明当前最先进的MLLM、推理技术(如GEPA、思维链、反思)和竞争性基线PReP在此具有挑战性的设置中表现显著不佳。为解决这一问题,我们提出了路径的口头化(VoP),通过从MLLM中探测城市规模的认知地图(关键地标和朝向目的地的方向)来明确地将智能体的内部推理接地,从而显著提升导航成功率。项目网页:https://dwipddalal.github.io/AgentNav/

关键词

引用

@article{arxiv.2512.15933,
  title  = {City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs},
  author = {Dwip Dalal and Utkarsh Mishra and Narendra Ahuja and Nebojsa Jojic},
  journal= {arXiv preprint arXiv:2512.15933},
  year   = {2026}
}

备注

Accepted at EACL 2026 (ORAL)