VLAW:视觉-语言-动作策略与世界模型的迭代共同改进
机器人学
2026-02-17 v2
摘要
本文旨在通过迭代在线交互来提高视觉-语言-动作(VLA)模型的性能和可靠性。由于在实际世界中收集策略 rollout 成本高昂,我们研究是否可以使用学习的模拟器——具体来说,是一种动作条件视频生成模型——来生成额外的 rollout 数据。不幸的是,现有的世界模型缺乏足以实现策略改进的物理保真度:它们主要在演示数据集上训练,后者缺乏对许多不同物理相互作用(特别是失败情形)的覆盖,难以准确建模接触丰富的物体操作中微小但关键的物理细节。我们提出了一种简单的方法,通过实际世界 rollout 数据改善世界模型的保真度,然后该模型反过来用于生成用于改进 VLA 模型的补充合成数据。在我们的实际机器人实验中,我们使用该方法改进了最先进的 VLA 模型在多个下游任务上的性能。我们实现了相对于基础策略的 39.2% 绝对成功率提升,以及 11.6% 的合成 rollout 训练提升。视频可在本匿名网站找到:https://sites.google.com/view/vla-w
引用
@article{arxiv.2602.12063,
title = {VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model},
author = {Yanjiang Guo and Tony Lee and Lucy Xiaoyang Shi and Jianyu Chen and Percy Liang and Chelsea Finn},
journal= {arXiv preprint arXiv:2602.12063},
year = {2026}
}
备注
Project Page: https://sites.google.com/view/vlaw-arxiv