中文

面向多目标操控任务的图结构策略学习

机器人学 2022-07-26 v1

摘要

机器人操控中的多目标策略学习具有挑战性。先前的成功案例使用了基于状态的物体表示或提供演示数据以辅助学习。在本文中,通过手工编码该领域的高层离散表示,我们展示了可利用单一网络通过基于像素的Q-learning学习到达数十个目标的策略。智能体将学习聚焦于更简单的局部策略,并在抽象空间中通过规划将其序列化。我们在一个具有挑战性的积木构建领域上,将我们的方法与标准多目标RL基线以及其他利用该离散表示的方法进行比较。我们发现我们的方法可构建百余种不同的积木结构,并展示了对含新颖物体的结构的前向迁移能力。最后,我们将仿真中学习的策略部署于真实机器人上。

关键词

引用

@article{arxiv.2207.11313,
  title  = {Graph-Structured Policy Learning for Multi-Goal Manipulation Tasks},
  author = {David Klee and Ondrej Biza and Robert Platt},
  journal= {arXiv preprint arXiv:2207.11313},
  year   = {2022}
}