中文

基于动态奖励课程的协作式Loco操控夹取-放置任务

机器人学 2025-09-17 v1

摘要

我们提出了用于训练单臂四足机器人执行抓取-放置 (P&P) 任务的分层强化学习管道,涵盖从接近有效载荷到将其放置在目标区域的全过程,适用于单机器人和协作双机器人场景。我们引入了一种新颖的动态奖励课程,使单个策略能够通过逐步引导代理人穿越有效载荷中心的子目标,高效学习长期程度的 P&P 操作。与针对长期程度强化学习任务的最新方法相比,我们的方法在仿真实验中将训练效率提高 55%,执行时间缩短 18.6%。在双机器人情况下,我们展示了该策略使每台机器人在不同任务阶段注意力空间的不同组件,从而通过自主注意力转移促进有效协作。我们通过单臂和双臂 ANYmal D 平台的实际实验验证了该方法。就我们知识而言,这是首个解决全范围协作式 P&P 任务的 RL 管道。

关键词

引用

@article{arxiv.2509.13239,
  title  = {Collaborative Loco-Manipulation for Pick-and-Place Tasks with Dynamic Reward Curriculum},
  author = {Tianxu An and Flavio De Vincenti and Yuntao Ma and Marco Hutter and Stelian Coros},
  journal= {arXiv preprint arXiv:2509.13239},
  year   = {2025}
}