利用基于势的奖励塑形与视频数据演示学习奔跑
机器学习
2020-12-17 v1 计算机视觉与模式识别
机器人学
摘要
从零开始为类人机器人学习生成高效运动行为是一个难题,正如 NIPS 2017 的“学习奔跑”竞赛所展示的那样。该竞赛的目标是训练一个两足类人身体模型在模拟赛道上以最大速度奔跑。所有提交方案都采用了强化学习(RL)的空白 slate(tabula rasa)方法,并能够产生相对快速但非最优的奔跑行为。在本文中,我们展示了如何利用人类奔跑视频(例如取自 YouTube)中的数据来塑形类人学习智能体的奖励,以加速学习并产生更好的结果。具体而言,我们使用规律时间间隔下关键身体部位的位置来定义基于势的奖励塑形(PBRS)的势函数。由于 PBRS 不改变最优策略,该方法使 RL 智能体能够克服视频中展示的人类运动中的次优性。我们提出了将 NIPS 竞赛前十方法中的选定技术与进一步优化相结合的实验,以创建一个高性能智能体作为基线。然后我们展示了基于视频的奖励塑形如何进一步提升性能,使得 RL 智能体在 12 小时训练中以两倍于基线的速度奔跑。我们进一步表明,我们的方法能够克服视频中的次优奔跑行为,所学策略显著优于视频中奔跑智能体的策略。
引用
@article{arxiv.2012.08824,
title = {Learning to Run with Potential-Based Reward Shaping and Demonstrations from Video Data},
author = {Aleksandra Malysheva and Daniel Kudenko and Aleksei Shpilman},
journal= {arXiv preprint arXiv:2012.08824},
year = {2020}
}