中文

利用大语言模型反馈加速机器人操作的强化学习

机器人学 2023-11-07 v1 人工智能 机器学习

摘要

强化学习(RL)在机器人操作领域中发挥着重要作用,因为它允许从与环境的试错交互中自我学习。然而,样本效率与奖励设定严重限制了其潜力。一种可能的解决方案涉及从专家指导中学习。但由于监督RL智能体的成本高昂,获取人类专家并不现实,且开发自动监督器是一项具有挑战性的工作。大语言模型(LLMs)展现出以自然语言对用户输出提供类人反馈的卓越能力。尽管如此,它们并非为直接控制底层机器人运动而设计,因为其预训练基于海量互联网数据而非特定机器人数据。本文引入Lafite-RL(语言智能体反馈交互式强化学习)框架,该框架通过利用LLM的及时反馈使RL智能体高效学习机器人任务。我们在RLBench任务上的实验表明,通过简单的自然语言提示设计,受LLM引导的Lafite-RL智能体表现出改进的学习能力,在学习效率与成功率方面均优于基线,凸显了LLM所提供奖励的有效性。

关键词

引用

@article{arxiv.2311.02379,
  title  = {Accelerating Reinforcement Learning of Robotic Manipulations via Feedback from Large Language Models},
  author = {Kun Chu and Xufeng Zhao and Cornelius Weber and Mengdi Li and Stefan Wermter},
  journal= {arXiv preprint arXiv:2311.02379},
  year   = {2023}
}

备注

CoRL 2023 Workshop (oral)