中文

SQUIRL:基于视频演示的长时间跨度机器人操作任务的鲁棒高效学习

机器人学 2020-03-12 v1 机器学习

摘要

深度强化学习(RL)近期的进展已展示其学习复杂机器人操作任务的潜力。然而,RL仍要求机器人收集大量真实世界经验。为解决该问题,近期工作提出从专家演示中学习(LfD),特别是通过逆强化学习(IRL),因其能以少量专家演示实现鲁棒性能。尽管如此,由于IRL需要大量机器人经验,在真实机器人上部署仍具挑战。本文旨在以一种鲁棒、样本高效且通用的元IRL算法SQUIRL解决该可扩展性挑战,该算法在仅给定单个视频演示时鲁棒地执行新的但相关的长时间跨度任务。首先,该算法利用行为克隆(BC)引导任务编码器和任务条件策略的学习。然后它收集真实机器人经验,并绕过奖励学习,直接从机器人与专家轨迹组合中恢复Q函数。接着,该算法使用Q函数重新评估机器人收集的所有累积经验以快速改进策略。最终,策略在新任务上比BC更鲁棒(90%+成功率),且在测试时无需试错。最后,我们的真实机器人与仿真实验展示了算法在不同状态空间、动作空间及基于视觉的操作任务(如拾取-倾倒-放置和拾取-搬运-丢弃)上的通用性。

关键词

引用

@article{arxiv.2003.04956,
  title  = {SQUIRL: Robust and Efficient Learning from Video Demonstration of Long-Horizon Robotic Manipulation Tasks},
  author = {Bohan Wu and Feng Xu and Zhanpeng He and Abhi Gupta and Peter K. Allen},
  journal= {arXiv preprint arXiv:2003.04956},
  year   = {2020}
}

备注

8 pages