中文

基于视觉的机器人抓取的深度强化学习:离策略方法的模拟对比评估

机器人学 2018-03-30 v2 机器学习 机器学习

摘要

在本文中,我们探索用于基于视觉的机器人抓取的深度强化学习算法。无模型深度强化学习(RL)已成功应用于一系列具有挑战性的环境,但算法的激增使得难以辨别哪种特定方法最适合像抓取这样丰富且多样的任务。为回答此问题,我们提出了一个强调离策略学习及对未见物体泛化的机器人抓取模拟基准。离策略学习能够利用针对多种物体的抓取数据,而多样性对于使方法泛化到训练期间未见过的新物体至关重要。我们针对该基准任务评估了多种 Q 函数估计方法、一种先前提出的基于深度神经网络模型的机器人抓取方法,以及一种基于蒙特卡洛回报估计与离策略校正相结合的新方法。我们的结果表明,几种简单方法出人意料地成为双 Q 学习等流行算法的强劲竞争者,并且我们对稳定性的分析阐明了算法之间的相对权衡。

关键词

引用

@article{arxiv.1802.10264,
  title  = {Deep Reinforcement Learning for Vision-Based Robotic Grasping: A Simulated Comparative Evaluation of Off-Policy Methods},
  author = {Deirdre Quillen and Eric Jang and Ofir Nachum and Chelsea Finn and Julian Ibarz and Sergey Levine},
  journal= {arXiv preprint arXiv:1802.10264},
  year   = {2018}
}

备注

8 pages