DexFlyWheel:面向精细操作的可扩展自我改进数据生成框架
机器人学
2025-09-30 v1
摘要
精细操作是机器人能力在实际应用中至关重要的挑战,但缺乏多样且高质量的数据集。现有数据收集方法要么依赖人类遥操作,要么需要大量人类工程,要么生成的数据多样性有限,这限制了其可扩展性和泛化能力。本文引入DexFlyWheel,一个可扩展的数据生成框架,采用自我改进循环持续丰富数据多样性。DexFlyWheel从高效的种子演示热身开始,通过迭代循环扩展数据集。每次循环遵循闭环流程,集成模仿学习(IL)、残差强化学习(RL)、 rollout轨迹收集与数据增强。具体而言,IL从演示中提取类人行为,残差RL提升策略的泛化性。所学策略随后用于仿真中生成轨迹,这些轨迹在多样化环境和空间配置下进行数据增强后反馈至下一个循环。随着连续迭代,形成自我改进的数据飞轮效应,产生覆盖多种情景的数据集,从而提升策略性能。实验结果表明,DexFlyWheel在四项具有挑战性的任务上生成了超过2000个多样化演示。基于我们的数据集训练的策略在挑战性测试集上实现81.9%的平均成功率,并通过数字孪生成功实现了在实际中的迁移,在双臂提升任务中达到78.3%的成功率。
引用
@article{arxiv.2509.23829,
title = {DexFlyWheel: A Scalable and Self-improving Data Generation Framework for Dexterous Manipulation},
author = {Kefei Zhu and Fengshuo Bai and YuanHao Xiang and Yishuai Cai and Xinglin Chen and Ruochong Li and Xingtao Wang and Hao Dong and Yaodong Yang and Xiaopeng Fan and Yuanpei Chen},
journal= {arXiv preprint arXiv:2509.23829},
year = {2025}
}
备注
NeurIPS 2025, Spotlight