中文

用于半监督与无监督技能发现的动态距离学习

机器学习 2020-02-17 v4 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

强化学习需要手动指定奖励函数以学习任务。虽然原则上该奖励函数只需指定任务目标,但实际上,除非对奖励函数进行塑形以提供朝向成功结果的平滑梯度,否则强化学习可能非常耗时甚至不可行。这种塑形难以手工指定,特别是当从原始观测(如图像)学习任务时。本文中,我们研究如何自动学习动态距离:一种从任意状态到达给定目标状态的期望时间步数的度量。这些动态距离可用于为到达新目标提供良好塑形的奖励函数,使得高效学习复杂任务成为可能。我们展示了动态距离可用于半监督机制:与环境无监督交互用于学习动态距离,而少量偏好监督用于确定任务目标,无需任何手动设计的奖励函数或目标示例。我们在真实世界机器人和仿真中评估了我们的方法。我们表明,我们的方法可以使用原始图像观测和仅十个偏好标签,在没有任何其他监督的情况下学会用真实世界 9-DoF 手转动阀门。所学技能的视频可在项目网站查看:https://sites.google.com/view/dynamical-distance-learning。

关键词

引用

@article{arxiv.1907.08225,
  title  = {Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery},
  author = {Kristian Hartikainen and Xinyang Geng and Tuomas Haarnoja and Sergey Levine},
  journal= {arXiv preprint arXiv:1907.08225},
  year   = {2020}
}

备注

11+6 pages, 6+2 figures, last two authors (Tuomas Haarnoja, Sergey Levine) advised equally