中文

用于风险感知视觉抓取的分位数 QT-Opt 算法

机器人学 2020-07-03 v3 机器学习 机器学习

摘要

强化学习(RL)的分布视角催生了一系列成功的 Q-learning 算法,在街机游戏环境中取得了最先进的性能。然而,这些来自离散环境的发现如何转化到以噪声、高维和连续状态-动作空间为特征的复杂实际应用中,尚未得到分析。在这项工作中,我们提出了分位数 QT-Opt(Q2-Opt),即最近提出的面向连续域的分布式 Q-learning 算法的分布变体,并在一系列模拟和真实视觉机器人抓取任务中检验其行为。Q2-Opt 中没有 actor,使我们能够直接与前人文献中的离散实验进行类比,而无需引入 actor-critic 架构带来的额外复杂性。我们证明 Q2-Opt 实现了更优的基于视觉的物体抓取成功率,同时具有更高的采样效率。分布形式还使我们能够尝试各种风险扭曲度量,从而指示机器人如何在使用深度强化学习控制策略时具体管理风险。作为额外贡献,我们在虚拟环境中进行了批量强化学习(batch RL)实验,并与离散环境的最新发现进行了比较。令人惊讶的是,我们发现文献中基于街机游戏环境得到的先前批量 RL 结论并不能推广到我们的设置中。

关键词

引用

@article{arxiv.1910.02787,
  title  = {Quantile QT-Opt for Risk-Aware Vision-Based Robotic Grasping},
  author = {Cristian Bodnar and Adrian Li and Karol Hausman and Peter Pastor and Mrinal Kalakrishnan},
  journal= {arXiv preprint arXiv:1910.02787},
  year   = {2020}
}

备注

Camera-ready version for RSS 2020. Contains 8 pages, 7 figures