中文

CorNav:具备自纠正规划的零样本视觉-语言导航自主智能体

计算机视觉与模式识别 2024-03-15 v3 人工智能 计算与语言

摘要

理解并遵循自然语言指令同时在复杂真实世界环境中导航,对通用机器人是重大挑战。这些环境常包含障碍物与行人,使自主智能体必须具备基于环境反馈调整动作的自纠正规划能力。然而,多数现有视觉-语言导航(VLN)方法主要在较不真实的模拟器中运行,且未将环境反馈纳入决策。为弥补此差距,我们提出一种名为 CorNav 的新型零样本框架,利用大语言模型进行决策,包含两个关键组件:1) 引入环境反馈以细化未来规划并调整动作;2) 多个领域专家用于解析指令、场景理解及细化预测动作。除框架外,我们开发了使用 Unreal Engine 5 渲染真实场景的 3D 模拟器。为评估零样本多任务下导航智能体的有效性与泛化性,我们创建了名为 NavBench 的基准。大量实验表明 CorNav 在所有任务上均以显著优势超越所有基线。平均而言,CorNav 成功率达 28.1%,优于最佳基线的 20.5%。

关键词

引用

@article{arxiv.2306.10322,
  title  = {CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation},
  author = {Xiwen Liang and Liang Ma and Shanshan Guo and Jianhua Han and Hang Xu and Shikui Ma and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2306.10322},
  year   = {2024}
}

备注

22 pages