CorNav:具备自纠正规划的零样本视觉-语言导航自主智能体
计算机视觉与模式识别
2024-03-15 v3 人工智能
计算与语言
摘要
理解并遵循自然语言指令同时在复杂真实世界环境中导航,对通用机器人是重大挑战。这些环境常包含障碍物与行人,使自主智能体必须具备基于环境反馈调整动作的自纠正规划能力。然而,多数现有视觉-语言导航(VLN)方法主要在较不真实的模拟器中运行,且未将环境反馈纳入决策。为弥补此差距,我们提出一种名为 CorNav 的新型零样本框架,利用大语言模型进行决策,包含两个关键组件:1) 引入环境反馈以细化未来规划并调整动作;2) 多个领域专家用于解析指令、场景理解及细化预测动作。除框架外,我们开发了使用 Unreal Engine 5 渲染真实场景的 3D 模拟器。为评估零样本多任务下导航智能体的有效性与泛化性,我们创建了名为 NavBench 的基准。大量实验表明 CorNav 在所有任务上均以显著优势超越所有基线。平均而言,CorNav 成功率达 28.1%,优于最佳基线的 20.5%。
引用
@article{arxiv.2306.10322,
title = {CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation},
author = {Xiwen Liang and Liang Ma and Shanshan Guo and Jianhua Han and Hang Xu and Shikui Ma and Xiaodan Liang},
journal= {arXiv preprint arXiv:2306.10322},
year = {2024}
}
备注
22 pages