中文

通过多样化重置和大规模强化学习实现灵巧性

机器人学 2026-04-03 v3

摘要

大规模并行物理仿真中的强化学习已推动了仿真到现实机器人学习的 major 进展。然而,当前方法仍然脆弱且任务特定,依赖对奖励函数、课程和演示进行大量任务特定工程设计。即便如此,这些方法在长期视角和接触丰富的操控任务上常常失败,且随计算规模而提升不明显,因为性能在训练时很快在同一窄范围的状态空间中饱和。我们引入 OmniReset—a 简单且可扩展的框架,使基于策略的强化学习能够使用单一奖励函数、固定算法参数、无课程安排和无人类演示,稳健地解决广泛的灵巧操控任务。我们的关键洞察是,通过使用仿真器重置来系统性地暴露 RL 算法于构成灵巧操控的多样化机器人-物体相互作用,从而大大简化了长期探索。OmniReset 通过最小的人类输入以程序化方式生成此类重置,将额外的计算转化为更广泛的行为覆盖和持续的性能提升。我们展示了 OmniReset 能平滑地扩展到超越现有方法能力范围的长期视角灵巧操控任务,并能够在显著更广泛的初始条件范围内学习出稳健的策略。最后,我们将 OmniReset 蒸馏为视觉-运动策略,显示出稳健的重试行为,并在零样本迁移到现实世界时,成功率显著高于基线方法。项目网页:https://weirdlabuw.github.io/omnireset/

关键词

引用

@article{arxiv.2603.15789,
  title  = {Emergent Dexterity via Diverse Resets and Large-Scale Reinforcement Learning},
  author = {Patrick Yin and Tyler Westenbroek and Zhengyu Zhang and Joshua Tran and Ignacio Dagnino and Eeshani Shilamkar and Numfor Mbiziwo-Tiapo and Simran Bagaria and Xinlei Liu and Galen Mullins and Andrey Kolobov and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2603.15789},
  year   = {2026}
}