从反应式到基于地图的 AI:面向对象目标导航的调优本地 LLM
计算机视觉与模式识别
2026-03-10 v1
摘要
对象目标导航 (ObjectNav) 需要智能体在未知环境中找到并导航到目标对象类别。虽然最近的大型语言模型 (LLM) 基于智能体展现出零样本推理能力,但它们往往依赖于“反应式”范式,缺乏明确的空间记忆,导致冗余探索和目标迟滞行为。为解决这些限制,我们提出了从反应式 AI 向“基于地图的 AI”的转变,通过将 LLM 基于语义推断与混合拓扑-网格映射系统相结合。我们的框架通过低秩适应 (LoRA) 对 Llama-2 进行微调,以从口语化对象观察中推断语义区域类别和目标存在概率。在本研究中,“区域”被定义为由观察到的对象集合描述的功能区域,为寻找目标提供了至关重要的语义共现线索。这种语义信息被整合到拓扑图中,使智能体能够优先考虑高概率区域,并通过旅行商问题 (TSP) 优化进行系统化探索。在 AI2-THOR 模拟器中的评估表明,我们的方法在常规的前沿探索和反应式 LLM 基线之上显著优于后者,实现了更高的成功率 (SR) 和以路径长度加权的成功率 (SPL)。
引用
@article{arxiv.2603.08086,
title = {From Reactive to Map-Based AI: Tuned Local LLMs for Semantic Zone Inference in Object-Goal Navigation},
author = {Yudai Noda and Kanji Tanaka},
journal= {arXiv preprint arXiv:2603.08086},
year = {2026}
}
备注
6 pages, 5 figures, technical report