中文

世界感知规划叙事提升大型视觉语言模型规划器

人工智能 2025-07-03 v2 机器人学

摘要

大型视觉语言模型(LVLMs)在具身规划任务中显示出巨大的潜力,但在涉及不熟悉环境和多步骤目标的复杂情景时仍存在挑战。当前方法依赖于环境无关的模仿学习,将指令与环境背景分离,导致模型在处理与环境相关的指令时困难,依赖补充线索而非视觉推理进行长程互动。在本工作中,我们提出了世界感知规划叙事增强(WAP)框架,通过四种认知能力(视觉外观建模、空间推理、功能抽象和句法 grounding)为LVLMs注入全面的环境理解能力。我们仅使用原始视觉观测开发和评估模型。针对EB-ALFRED基准测试进行评估,显示出显著的改进,Qwen2.5-VL在任务成功率上实现了60.7的绝对提升,尤其是在常识推理(+60.0)和长程规划(+70.0)方面。值得注意的是,我们的增强型开源模型在性能上大幅超越了GPT-4o和Claude-3.5-Sonnet等专有系统。

关键词

引用

@article{arxiv.2506.21230,
  title  = {World-aware Planning Narratives Enhance Large Vision-Language Model Planner},
  author = {Junhao Shi and Zhaoye Fei and Siyin Wang and Qipeng Guo and Jingjing Gong and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2506.21230},
  year   = {2025}
}