中文

基于策略梯度方法的机器人乒乓球最优击球学习

机器人学 2022-10-11 v2

摘要

对机器人而言,学习打乒乓球是一项具有挑战性的任务,因为其需要多种多样的击球方式。近期进展表明,深度强化学习(RL)能够在仿真环境中成功学习最优动作。然而,由于较高的探索代价,RL 在真实场景中的适用性仍然有限。本工作中,我们提出了一个真实感仿真环境,其中为球的动力学与机器人的运动学建立了多个模型。我们未训练端到端 RL 模型,而是提出了一种以 TD3 为骨干、基于击球时刻球预测状态的策略梯度方法来学习球拍击球。实验中,我们表明所提方法在仿真中显著优于现有 RL 方法。此外,为跨越从仿真到现实的领域鸿沟,我们采用了一种高效的再训练方法,并在三种真实场景中进行了测试。最终成功率达 98%,距离误差约为 24.9 cm。总训练时间约 1.5 小时。

关键词

引用

@article{arxiv.2109.03100,
  title  = {Optimal Stroke Learning with Policy Gradient Approach for Robotic Table Tennis},
  author = {Yapeng Gao and Jonas Tebbe and Andreas Zell},
  journal= {arXiv preprint arXiv:2109.03100},
  year   = {2022}
}