世界指引:基于条件空间的行动生成中的世界建模
机器人学
2026-02-26 v1 计算机视觉与模式识别
摘要
利用未来观察建模来促进动作生成为提高视觉语言动作(VLA)模型能力的有前景的途径。然而,现有方法难以在保持高效可预测的未来表示与保留足够细粒度信息以指导精确动作生成之间取得平衡。为此,我们提出了 WoG(World Guidance),一个将未来观察映射到紧凑条件并注入动作推断管道的框架。VLA 随后被训练同时预测这些压缩条件以及未来动作,从而在动作推断的条件空间中实现有效的世界建模。我们表明,建模和预测此条件空间不仅有助于细粒度动作生成,而且显示出优异的泛化能力。此外,它能有效地从大量人类操作视频中学习。广泛的实验在仿真和真实世界环境中均验证了我们的方法显著优于基于未来预测的现有方法。项目页面可在:https://selen-suyue.github.io/WoGNet/ 查看。
引用
@article{arxiv.2602.22010,
title = {World Guidance: World Modeling in Condition Space for Action Generation},
author = {Yue Su and Sijin Chen and Haixin Shi and Mingyu Liu and Zhengshen Zhang and Ningyuan Huang and Weiheng Zhong and Zhengbang Zhu and Yuxiao Liu and Xihui Liu},
journal= {arXiv preprint arXiv:2602.22010},
year = {2026}
}
备注
Project Page: https://selen-suyue.github.io/WoGNet/