中文

RaC:通过扩展恢复与纠正实现机器人学习长期任务

机器人学 2025-09-10 v1 机器学习

摘要

现代机器人仿照训练范式会在大量人类演示数据上训练出表达性强的策略架构。然而,在接触丰富、可变形物体和长期任务上,性能远远落后于完美执行,即使使用数千次专家演示也是如此。这源于现有基于人类遥控的“专家”数据收集程序的低效。在解决此问题方面,我们引入了RaC,即在仿照学习预训练后进行的人类在环 rollout 训练的一个新阶段。在RaC中,我们针对人类干预轨迹进行微调,这些轨迹展示了恢复和纠正行为。具体而言,在策略 rollout期间,当失败即将发生时,人类操作员会进行干预,首先将机器人 rewind 回到熟悉的、在分布内的状态,然后提供一个完成当前子任务的纠正段。对该数据的训练扩展了机器人的技能储备,使其包括重试和适应行为,这些行为对提高长期任务的效率和鲁棒性至关重要。在三个真实世界的双手控制任务中:衬衫挂晾、密封容器盖封口、外卖盒包装,以及一个模拟装配任务中,RaC 在数据收集时间和样本数上均超过了先前的最佳成绩。我们还展示了RaC能够实现测试时扩展:训练好的RaC策略在所表现的恢复动作数量上呈线性增长。学习的策略视频可在 https://rac-scaling-robot.github.io/ 查看。

关键词

引用

@article{arxiv.2509.07953,
  title  = {RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction},
  author = {Zheyuan Hu and Robyn Wu and Naveen Enock and Jasmine Li and Riya Kadakia and Zackory Erickson and Aviral Kumar},
  journal= {arXiv preprint arXiv:2509.07953},
  year   = {2025}
}