中文

基于视觉的物体操控中非参数策略与动作基元的强化学习

机器人学 2022-06-22 v1

摘要

物体操控是服务机器人的关键能力,但由于样本效率等原因很难用强化学习解决。本文中,为应对该物体操控问题,我们提出一种新框架 AP-NPQL(带动作基元的非参数 Q 学习),其通过利用用于强化学习的非参数策略以及针对物体操控的合适行为先验,能高效解决带视觉输入与稀疏奖励的物体操控。我们在仿真中对四项物体操控任务(推盘子、叠盒子、翻杯子、拾放盘子)评估了所提 AP-NPQL 的效率与性能,结果表明我们的 AP-NPQL 在学习时间与任务成功率方面优于基于参数策略与行为先验的先进算法。我们还以仿真到真实的方式成功迁移并验证了盘子拾放任务所学策略至真实机器人。

关键词

引用

@article{arxiv.2206.05671,
  title  = {Reinforcement Learning for Vision-based Object Manipulation with Non-parametric Policy and Action Primitives},
  author = {Dongwon Son and Myungsin Kim and Jaecheol Sim and Wonsik Shin},
  journal= {arXiv preprint arXiv:2206.05671},
  year   = {2022}
}