中文

基于无模型强化学习的机器人乒乓球

机器学习 2020-05-29 v2 机器人学 机器学习

摘要

我们提出一种无模型算法,用于学习以 100Hz 速率控制机器人关节、能够回击乒乓球的高效策略。我们证明,作用于基于 CNN 的非视觉输入策略架构并跨时间卷积的进化搜索(ES)方法可学习到产生平滑运动的紧凑控制器。此外,我们表明通过对任务和奖励进行适当的课程学习调优,策略能够发展出多模态风格,具体为 forehand 和 backhand 击球,同时在广泛的抛球范围内达到 80% 的回球率。我们观察到多模态不需要任何架构先验,例如多头架构或分层策略。

关键词

引用

@article{arxiv.2003.14398,
  title  = {Robotic Table Tennis with Model-Free Reinforcement Learning},
  author = {Wenbo Gao and Laura Graesser and Krzysztof Choromanski and Xingyou Song and Nevena Lazic and Pannag Sanketi and Vikas Sindhwani and Navdeep Jaitly},
  journal= {arXiv preprint arXiv:2003.14398},
  year   = {2020}
}

备注

V2: new URL of supplementary video. 8 pages, 4 figures