中文

从玩耍中学习可供性以实现样本高效的策略学习

机器人学 2022-03-02 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在以人为中心的环境中操作的机器人应具备理解物体功能的能力:每个物体能做什么,这种交互可能发生在哪里,以及如何使用该物体来实现目标。为此,我们提出了一种新颖的方法,该方法从人类遥操作的玩耍数据中提取自监督的视觉可供性模型,并利用它来实现高效的策略学习和运动规划。我们将基于模型的规划与无模型的深度强化学习(RL)相结合,以学习那些偏好与人类偏好相同的物体区域的策略,同时只需要机器人与环境进行最少的交互。我们通过多样的仿真操作任务和真实世界的机器人整理实验来评估我们的算法——视觉可供性引导的策略优化(VAPO),以证明我们可供性引导策略的有效性。我们发现,我们的策略训练速度比基线快4倍,并且由于我们的视觉可供性模型能够预测新物体的可供性区域,因此能更好地泛化到新物体上。

关键词

引用

@article{arxiv.2203.00352,
  title  = {Affordance Learning from Play for Sample-Efficient Policy Learning},
  author = {Jessica Borja-Diaz and Oier Mees and Gabriel Kalweit and Lukas Hermann and Joschka Boedecker and Wolfram Burgard},
  journal= {arXiv preprint arXiv:2203.00352},
  year   = {2022}
}

备注

Accepted at the 2022 IEEE International Conference on Robotics and Automation (ICRA). Videos at http://vapo.cs.uni-freiburg.de/