中文

InternData-A1:面向通用策略预训练的高保真合成数据

机器人学 2025-11-21 v1

摘要

近期研究探讨了真实数据与合成数据对视觉-语言-动作 (Vision-Language-Action, VLA) 模型泛化能力的贡献。虽然当前 VLA 模型显示出大规模真实机器人预训练的强大效果,但合成数据尚未在规模上展现出相当的能力。本文提供首次证据表明,仅使用合成数据即可匹配最强 π\pi-dataset 在预训练 VLA 模型方面的性能,揭示了大规模仿真的重大价值。生成的模型在几个具有挑战性的任务上展现出惊人的零样本仿真到现实迁移能力。我们的合成数据集 InternData-A1 包含超过 63 万条轨迹和 7433 小时的跨 4 种机体、18 项技能、70 项任务和 227 个场景的数据,涵盖刚性、关节、可变形和流体对象操作。它通过高度自主、完全解耦且可组合的仿真管线生成,支持长期技能组合、灵活任务组装和异构机体,无需大量手动调参。我们采用与 π0\pi_0 相同的数据架构,对 InternData-A1 进行预训练,发现其在 49 个仿真任务、5 个真实世界任务和 4 项长臂柔性任务上均与官方 π0\pi_0 持平。我们将发布该数据集,并开源生成管线,以便更广泛地获取大规模机器人数据,降低具身 AI 研究中大规模数据创建的门槛。

关键词

引用

@article{arxiv.2511.16651,
  title  = {InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy},
  author = {Yang Tian and Yuyin Yang and Yiman Xie and Zetao Cai and Xu Shi and Ning Gao and Hangxu Liu and Xuekun Jiang and Zherui Qiu and Feng Yuan and Yaping Li and Ping Wang and Junhao Cai and Jia Zeng and Hao Dong and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2511.16651},
  year   = {2025}
}