中文

Video2Reward:从视频生成脚底机器人行为的奖励函数

机器人学 2025-07-01 v1 计算机视觉与模式识别 机器学习

摘要

脚底机器人行为的学习由于其固有的不稳定性和复杂约束, presents 一个重大挑战。最近的研究提出使用大语言模型(LLM)生成强化学习中的奖励函数,从而取代专家手动设计奖励函数的需求。然而,这种依赖文本描述来定义学习目标的方法,无法实现可控且精确的行为学习。本文提出一种新的 video2reward 方法,直接从描绘要模仿和学习的行为的视频中生成奖励函数。具体而言,我们首先处理包含目标行为的视频,将视频中个体的运动信息转换为通过视频到文本转换模块表示为坐标的关键点轨迹。然后将这些轨迹输入 LLM 以生成奖励函数,进而用于训练策略。为提高奖励函数的质量,我们开发了一种视频辅助的迭代奖励细化方案,通过视觉评估所学习的行为并提供文本反馈给 LLM。该反馈指导 LLM 持续细化奖励函数,从而促进更高效的行为学习。在双足和四足机器人运动控制任务的实验结果表明,我们的方法在人类标准化分数上优于基于 LLM 的最先进奖励生成方法超过 37.6%。更重要的是,通过更换视频输入,我们发现该方法能够快速学习各种运动行为,如行走和跑步。

关键词

引用

@article{arxiv.2412.05515,
  title  = {Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning},
  author = {Runhao Zeng and Dingjie Zhou and Qiwei Liang and Junlin Liu and Hui Li and Changxin Huang and Jianqiang Li and Xiping Hu and Fuchun Sun},
  journal= {arXiv preprint arXiv:2412.05515},
  year   = {2025}
}

备注

8 pages, 6 figures, ECAI2024