通过仿真引导微调实现策略对真实世界的快速适应
机器人学
2025-02-06 v1 机器学习
摘要
机器人学习需要大量高质量数据来实现泛化的承诺。然而,在真实世界中收集大规模数据集成本高昂。物理模拟器可以廉价地生成覆盖广泛状态、动作和环境的大规模数据集。然而,物理引擎从根本上是对现实的错误指定近似。这使得从仿真到现实的直接零样本迁移具有挑战性,尤其是在需要精确且力敏感操作的任务中。因此,使用小型真实世界数据集对这些策略进行微调,是扩展机器人学习的一条有吸引力的途径。然而,当前的强化学习微调框架利用通用的、非结构化的探索策略,这些策略效率太低,无法使真实世界适应变得实用。本文介绍了仿真引导微调(SGFT)框架,该框架展示了如何从物理模拟器中提取结构先验,以显著加速真实世界适应。具体来说,我们的方法使用在仿真中学习的价值函数来指导真实世界的探索。我们在五个零样本仿真到现实迁移失败的真实世界灵巧操作任务中展示了这种方法。我们进一步证明,我们的框架显著优于基线微调方法,所需的真实世界样本数量最多减少一个数量级,并在先前方法完全失败的困难任务中取得成功。最后但同样重要的是,我们为这一新范式提供了理论证明,该证明支撑了SGFT如何在面对巨大的仿真到现实动力学差距时,快速学习高性能策略。项目网页:https://weirdlabuw.github.io/sgft/{weirdlabuw.github.io/sgft}
引用
@article{arxiv.2502.02705,
title = {Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning},
author = {Patrick Yin and Tyler Westenbroek and Simran Bagaria and Kevin Huang and Ching-an Cheng and Andrey Kobolov and Abhishek Gupta},
journal= {arXiv preprint arXiv:2502.02705},
year = {2025}
}