中文

学习推理与导航:基于大型语言模型的参数高效动作规划

计算机视觉与模式识别 2025-05-13 v1

摘要

远程本体化指称任务 (REVERIE) 需要智能体通过复杂室内环境导航并定位由高层指令指定的远程物体,如“给我拿个勺子”,且无需预先探索。因此,有效的导航计划对最终成功至关重要。本文提出一种 novel 的参数高效动作规划方法,利用大型语言模型 (PEAP-LLM) 在每个位置生成单步指令。 proposed 模型包含两个模块,LLM 目标规划器 (LGP) 和 LoRA 动作规划器 (LAP)。首先,LGP 从 REVERIE 指令中提取目标导向计划,包括目标物体和房间。然后,LAP 基于目标导向计划、高层指令和当前视觉观察生成单步指令。PEAP-LLM 使具身智能体能够作为 LAP 在运行时与之交互作为路径规划器。对大型语言模型的直接应用几乎无法获得良好性能。此外,现有的基于硬提示的方法在复杂情境下容易出错且需要人工干预。为解决这些问题并防止大型语言模型生成幻觉和偏见信息,我们提出一种新的两阶段微调方法,包括监督式微调 (STF) 和直接偏好优化 (DPO)。SFT 改善生成指令的质量,而 DPO 利用环境反馈。实验结果表明,我们提出的模型在 REVERIE 上的性能优于以前的 state-of-the-art 方法。

关键词

引用

@article{arxiv.2505.07500,
  title  = {Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models},
  author = {Bahram Mohammadi and Ehsan Abbasnejad and Yuankai Qi and Qi Wu and Anton Van Den Hengel and Javen Qinfeng Shi},
  journal= {arXiv preprint arXiv:2505.07500},
  year   = {2025}
}