中文

基于运动感知的快速奖励优化:高效从单视频学习机器人技能

机器人学 2025-05-14 v1

摘要

视觉语言模型(VLM)已展示出优异的高层规划能力,使机器人能够无需精细的人类级奖励设计即可从视频演示中学习 locomotion 技能。然而,当前方法的错误帧采样方法和低训练效率仍是关键瓶颈,导致计算开销和时间成本显著增加。为此,我们提出运动感知快速奖励优化以高效学习机器人技能的方法(MA-ROESL)。MA-ROESL集成运动感知帧选择方法,以隐式提升VLM生成奖励函数的质量。进一步采用三阶段混合训练流程,通过快速奖励优化提高训练效率,并通过在线微调得到最终策略。实验结果表明,MA-ROESL在模拟和真实环境中显著提升了训练效率,同时忠实再现 locomotion 技能,凸显其作为高效可扩展框架的潜力,用于从视频演示中学习机器人 locomotion 技能。

关键词

引用

@article{arxiv.2505.08367,
  title  = {MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos},
  author = {Xianghui Wang and Xinming Zhang and Yanjun Chen and Xiaoyu Shen and Wei Zhang},
  journal= {arXiv preprint arXiv:2505.08367},
  year   = {2025}
}