从野生动物视频中进行强化学习
机器人学
2024-12-06 v1 计算机视觉与模式识别
机器学习
摘要
我们提出一种通过观察网络上数千段野生动物视频(例如自然纪录片中展示的视频)来学习四足机器人的 locomotion 技能的方法。事实上,这些视频提供了丰富且多样的可行运动示例,可为机器人的运动方式提供指导。为实现此目标,我们引入了强化学习从野生动物视频 (Reinforcement Learning from Wild Animal Videos, RLWAV) 方法,以将这些运动 grounded 到物理机器人上。我们首先在大规模动物视频数据集上训练视频分类器,以从 RGB 剪辑中识别动物在自然栖息地中的动作。随后,我们训练一个多技能策略,利用捕捉机器人运动视频的第三人称摄像机的分类得分作为强化学习奖励,在物理模拟器中控制机器人。最后,我们直接将所学策略迁移到真实的四足机器人 Solo 上。尽管动物在野外与机器人之间的领域和本体差异极大,但我们的 approach 能够使策略学习 diverse skills 如行走、跳跃和保持静止,无需依赖参考轨迹或技能特定奖励。
引用
@article{arxiv.2412.04273,
title = {Reinforcement Learning from Wild Animal Videos},
author = {Elliot Chane-Sane and Constant Roux and Olivier Stasse and Nicolas Mansard},
journal= {arXiv preprint arXiv:2412.04273},
year = {2024}
}
备注
Project website: https://elliotchanesane31.github.io/RLWAV/