中文

Prior Reinforce:在有限次数试验中掌握敏捷任务

机器人学 2025-09-30 v2

摘要

如今的具身机器人已经能够处理许多现实世界的操作任务。然而,某些涉及动态过程的其他现实世界任务(例如将篮球投入篮筐)具有极高的敏捷性,并对结果施加了高精度要求,这给主要为准静态操作设计的方法带来了额外挑战。这导致了在昂贵的数据收集、繁琐的奖励设计或复杂的运动规划方面投入增加。然而,此类任务对人类来说挑战要小得多。例如,一名新手篮球运动员通常只需约 10 次尝试即可完成首次成功投篮,其方式是粗略模仿某些运动先验,然后根据过往结果迭代调整其动作。受此人类学习范式启发,我们提出了 Prior Reinforce(P.R.),这是一种简单且可扩展的方法,它首先从极少的演示中学习运动模式,然后基于少量现实世界试验的反馈迭代地优化其生成的运动,直至达到特定目标。实验表明,Prior Reinforce 能够直接在现实世界中以人类水平的精度和效率学习并完成各种目标条件的敏捷动态任务,例如在不到 10 次试验中将篮球投入篮筐。项目网站:https://adap-robotics.github.io/。

关键词

引用

@article{arxiv.2505.21916,
  title  = {Prior Reinforce: Mastering Agile Tasks with Limited Trials},
  author = {Yihang Hu and Pingyue Sheng and Yuyang Liu and Shengjie Wang and Yang Gao},
  journal= {arXiv preprint arXiv:2505.21916},
  year   = {2025}
}