RE-MOVE:基于语言反馈的动态环境机器人导航任务自适应策略设计
机器人学
2023-09-19 v2 人工智能
机器学习
摘要
基于强化学习的连续控制机器人导航任务策略在实时部署中常无法适应环境的改变,可能导致灾难性失败。为解决此局限,我们提出一种称为 RE-MOVE(REquest help and MOVE on)的新方法,通过利用基于语言的反馈,使已训练策略适应实时环境变化而无需重新训练。该方法本质上归结为应对两个主要挑战:(1)何时请求反馈,以及若收到反馈,(2)如何将反馈融入已训练策略。RE-MOVE 结合基于认知不确定性的框架以确定请求基于指令反馈的最佳时机。针对第二挑战,我们采用零样本学习自然语言处理(NLP)范式,配合高效提示设计,并借助最先进的 GPT-3.5、Llama-2 语言模型。为展示所提方法的效能,我们在多个测试时动态导航场景中进行了广泛的合成与真实世界评估。与替代方法相比,使用 RE-MOVE 在成功到达目标上提升高达 80%,同时归一化轨迹长度减少 13.50%,尤其在具感知挑战的高要求真实世界环境中。
引用
@article{arxiv.2303.07622,
title = {RE-MOVE: An Adaptive Policy Design for Robotic Navigation Tasks in Dynamic Environments via Language-Based Feedback},
author = {Souradip Chakraborty and Kasun Weerakoon and Prithvi Poddar and Mohamed Elnoor and Priya Narayanan and Carl Busart and Pratap Tokekar and Amrit Singh Bedi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2303.07622},
year = {2023}
}