中文

感知、反思与规划:设计无需指令的 LLM 智能体进行目标导向城市导航

人工智能 2024-10-18 v3

摘要

本文考虑城市导航场景:一个 AI 智能体获得相对于某些知名地标的目标位置语言描述;仅通过观察周围场景,包括识别地标和道路网络连接,智能体必须在没有指令的情况下做出导航至目标位置的决策。这个问题极具挑战性,因为它要求智能体建立自身定位并获取复杂城市环境的空间表征,而地标往往不可见。在缺乏导航指令的情况下,这些能力对于智能体在长距离城市导航中做出高质量决策至关重要。随着大型语言模型(LLM)推理能力的涌现,一个诱人的基线方法是提示 LLM 对每次观察做出'反应'并据此做出决策。然而,该基线方法性能很差,智能体经常重复访问相同位置并做出目光短浅、不一致的决策。为了解决这些问题,本文提出了一种新颖的智能体工作流,其特点是具备感知、反思和规划的能力。具体而言,我们发现 LLaVA-7B 可以经过微调,以足够的精度感知地标的方向和距离,从而实现城市导航。此外,反思通过一种记忆机制实现,过去的经验被存储并可与当前感知一起检索,用于有效的决策论证。规划利用反思结果生成长期计划,从而避免长距离导航中的目光短浅决策。我们表明,与最先进的基线方法相比,所设计的工作流显著提升了 LLM 智能体的导航能力。

关键词

引用

@article{arxiv.2408.04168,
  title  = {Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions},
  author = {Qingbin Zeng and Qinglong Yang and Shunan Dong and Heming Du and Liang Zheng and Fengli Xu and Yong Li},
  journal= {arXiv preprint arXiv:2408.04168},
  year   = {2024}
}