中文

信任之前:基础模型在导航中的决策失败

人工智能 2026-04-09 v5 机器人学

摘要

导航相关任务的高成功率并不一定转化为基础模型可靠的决策制定。为了检验这一差距,我们在涵盖三种设置的六个诊断任务上评估了当前模型:完全空间信息下的推理、不完全空间信息下的推理以及安全相关信息下的推理。我们的结果表明,当前指标可能无法捕捉模型的关键局限性,并显示出良好的性能,这强调了需要以失败为中心的分析来理解模型局限性并指导未来进展。在一个包含未知单元格的路径规划设置中,GPT-5取得了93%的高成功率;然而,失败案例暴露了模型的基本局限性,例如缺乏导航所必需的结构化空间理解。我们还发现,在这方面,较新的模型并不总是比其前代更可靠。在安全相关信息下的推理中,Gemini-2.5 Flash在具有挑战性的紧急疏散任务上仅达到67%的成功率,表现不及在相同条件下达到100%的Gemini-2.0 Flash。在所有评估中,模型都表现出结构性崩溃、幻觉推理、约束违反和不安全决策。这些发现表明,基础模型在导航相关的决策制定中仍然存在重大失败,在获得信任之前需要进行细粒度的评估。

关键词

引用

@article{arxiv.2601.05529,
  title  = {Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models},
  author = {Jua Han and Jaeyoon Seo and Jungbin Min and Sieun Choi and Huichan Seo and Jihie Kim and Jean Oh},
  journal= {arXiv preprint arXiv:2601.05529},
  year   = {2026}
}

备注

Corrected author order in metadata; manuscript changed