中文

利用生成式 3D 世界扩展机器人视觉语言动作模型的模拟到真实强化学习

机器人学 2026-03-31 v2 人工智能 机器学习

摘要

大型视觉语言模型(VLM)通过强化学习训练表现出色的能力,推动了类似方法用于在机器人领域微调视觉语言动作(VLA)模型。许多近期工作直接在真实世界中进行 VLA 微调,以规避解决模拟到真实鸿沟的问题。虽然真实世界的强化学习规避了模拟到真实的问题,但其本质上限制了结果 VLA 的通用性,因为在物理世界中扩展场景和对象多样性在实际操作中极其困难。这导致将广泛预训练的模型转化为过拟合、场景特定策略的悖论性结果。训练在模拟环境中可以提供多样化的场景,但设计这些场景也昂贵。本文展示了 VLA 可通过利用 3D 世界生成模型进行强化学习微调,而不牺牲通用性且减少劳动负担。我们利用这些模型配合语言驱动的场景设计器,生成数百个包含独特对象和背景的多样化交互场景,实现可扩展且高度并行的策略学习。从预训练的模仿基线开始,我们的方法将仿真成功率从 9.7% 提升至 79.8%,同时实现任务完成时间的 1.25 倍加速。我们进一步展示了通过生成的数字孪生质量以及域随机化实现的成功模拟到真实迁移,使真实世界的成功率从 21.7% 提升至 75%,实现 1.13 倍的加速。最后,我们进一步通过实证无限数据来自 3D 世界生成模型的优势进行了消融研究,表明增加场景多样性直接改善了零样本泛化能力。

关键词

引用

@article{arxiv.2603.18532,
  title  = {Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds},
  author = {Andrew Choi and Xinjie Wang and Zhizhong Su and Wei Xu},
  journal= {arXiv preprint arXiv:2603.18532},
  year   = {2026}
}