中文

语言模型辅助的双层规划用于从互联网视频中学习奖励

机器人学 2024-10-15 v1 人工智能

摘要

从生物学专家(如人类和动物)那里进行学习,常常面临着显著的数据获取挑战。虽然最近的研究方法利用互联网视频进行学习,但需要复杂的、特定于任务的管线来提取和重新映射运动数据以适用于智能体。在本工作中,我们引入了一种语言模型辅助的双层规划框架,使强化学习智能体能够直接从互联网视频中学习其奖励,从而绕过专门的数据准备。该框架包括两个层次:上层使用视觉语言模型(VLM)通过比较学习者的行为与专家视频来提供反馈;下层使用大语言模型(LLM)将此反馈转化为奖励更新。在该双层框架中,VLM 和 LLM 合作,使用“链式法则”方法推导出奖励学习的有效搜索方向。我们对从 YouTube 视频中学习奖励进行了验证,结果表明,所提出的方法能够高效地从生物学专家视频中设计奖励,以实现复杂行为的合成。

关键词

引用

@article{arxiv.2410.09286,
  title  = {Language-Model-Assisted Bi-Level Programming for Reward Learning from Internet Videos},
  author = {Harsh Mahesheka and Zhixian Xie and Zhaoran Wang and Wanxin Jin},
  journal= {arXiv preprint arXiv:2410.09286},
  year   = {2024}
}