中文

机器人乒乓球中的样本高效强化学习

机器人学 2024-01-05 v4 人工智能

摘要

强化学习(RL)近来在各种计算机游戏和仿真中取得了一些令人瞩目的成功。这些成功大多基于智能体可从中学习的大量回合。然而,在典型的机器人应用中,可行尝试的次数非常有限。本文提出一种样本高效的 RL 算法,并以乒乓球机器人为例加以应用。在乒乓球中,每一次击球都不同,落点、速度和旋转各异。因此必须依据高维连续状态空间找到准确的回球。为使少回合学习成为可能,该方法被嵌入我们的机器人系统中。借此我们可使用单步环境。状态空间取决于击球时刻的球(位置、速度、旋转),动作为击球时刻的球拍状态(朝向、速度)。为加速学习,开发了基于 actor-critic 的确定性策略梯度算法。我们的方法在仿真和真实机器人上的一系列挑战性场景中均具竞争力。无需预训练,在少于 200200 个训练回合内即获得准确结果。展示我们实验的视频见 https://youtu.be/uRAtdoL6Wpw。

关键词

引用

@article{arxiv.2011.03275,
  title  = {Sample-efficient Reinforcement Learning in Robotic Table Tennis},
  author = {Jonas Tebbe and Lukas Krauch and Yapeng Gao and Andreas Zell},
  journal= {arXiv preprint arXiv:2011.03275},
  year   = {2024}
}

备注

accepted at ICRA 2021 (Xian, China)