基于视频的强化学习:结合离线观测与交互
机器学习
2021-11-08 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
强化学习是机器人从经验中获取技能的强有力框架,但通常需要大量的在线数据收集。因此,很难收集到机器人广泛泛化所需的足够多样的经验。另一方面,人类视频是易于获取的广泛且有趣的经验来源。在本文中,我们考虑如下问题:我们能否直接对人类收集的经验进行强化学习?这一问题尤其困难,因为此类视频未标注动作,并且相对于机器人的具身表现出显著的视觉域偏移。为应对这些挑战,我们提出了一种基于视频的强化学习框架(RLV)。RLV 利用人类收集的经验与机器人收集的数据相结合来学习策略和价值函数。在我们的实验中,我们发现 RLV 能够利用此类视频以少于从零开始学习的 RL 方法一半的样本量来学习具有挑战性的基于视觉的技能。
引用
@article{arxiv.2011.06507,
title = {Reinforcement Learning with Videos: Combining Offline Observations with Interaction},
author = {Karl Schmeckpeper and Oleh Rybkin and Kostas Daniilidis and Sergey Levine and Chelsea Finn},
journal= {arXiv preprint arXiv:2011.06507},
year = {2021}
}