中文

机器人学习中的超线性规模

机器人学 2025-10-14 v3 人工智能 机器学习

摘要

机器人学习的规模化需要能够随人类努力呈比例增长的数据收集管道。本文提出了面向机器人学习的 CASHER(Crowdsourcing and Amortizing Human Effort for Real-to-Sim-to-Real),一种实现在仿真环境中进行数据收集和学习的管道,其中性能随人类努力呈超线性增长。关键思想是通过 3D 重建众包真实场景的数字孪 replica,并在仿真环境中收集大规模数据,而非在真实世界中。数据收集最初由强化学习驱动,初始以人类演示为启动。随着在不同环境中训练通用策略的进行,其泛化能力可用于用模型生成的演示取代人类努力。这一结果表明,行为数据在仿真环境中收集,且随着约束满足的不同阶段,人类努力不断减少。我们展示了 CASHER 在三个真实任务上实现了零样本和少样本规模化定律。我们还表明,CASHER 能够使用视频扫描对预训练的策略进行微调,而无需任何额外的人类努力。项目网站: https://casher-robot-learning.github.io/CASHER/

关键词

引用

@article{arxiv.2412.01770,
  title  = {Robot Learning with Super-Linear Scaling},
  author = {Marcel Torne and Arhan Jain and Jiayi Yuan and Vidaaranya Macha and Lars Ankile and Anthony Simeonov and Pulkit Agrawal and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2412.01770},
  year   = {2025}
}