中文

ReBot:面向机器人学习的实到仿到实视频合成扩展

计算机视觉与模式识别 2025-03-20 v1 图形学 机器人学

摘要

视觉语言动作 (VLA) 模型通过直接训练于像素化机器人数据集(如 Open X-Embodiment)呈现出广阔的前景。然而,现实世界数据收集的高昂成本阻碍了数据规模的进一步扩张,从而限制了 VLA 模型的泛化能力。本文我们引入 ReBot,一种新颖的实到仿到实方法,用于扩展真实机器人数据集并适配 VLA 模型以适应目标领域,这是机器人操作中最后一英里的部署挑战。具体而言,ReBot 在仿真中重放真实世界机器人轨迹以多样化操作对象(实到仿),并将仿真运动与 inpainted 真实世界背景集成,以合成物理上真实且时序一致的机器人视频(仿到实)。我们方法的几项优势:1) 它受益于真实数据以缩小仿真到现实的差距;2) 它利用仿真的可扩展性;3) 它可完全自动化地将预训练 VLA 适配到目标领域。广泛的实验在仿真和真实环境中显示,ReBot 显著提升了 VLA 的性能和鲁棒性。例如,在使用 WidowX 机器人进行的 SimplerEnv 中,ReBot 将 Octo 的领域内性能提升 7.2%,OpenVLA 提升 21.8%,并分别提升 19.9% 和 9.4% 的领域外泛化。对于使用 Franka 机器人的真实世界评估,ReBot 将 Octo 的成功率提高 17%,OpenVLA 提高 20%。更多信息请访问:https://yuffish.github.io/rebot/

关键词

引用

@article{arxiv.2503.14526,
  title  = {ReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis},
  author = {Yu Fang and Yue Yang and Xinghao Zhu and Kaiyuan Zheng and Gedas Bertasius and Daniel Szafir and Mingyu Ding},
  journal= {arXiv preprint arXiv:2503.14526},
  year   = {2025}
}

备注

Website: https://yuffish.github.io/rebot/