基于视频先验的统一 4D 世界动作建模与异步去噪
机器人学
2026-05-08 v2 人工智能
计算机视觉与模式识别
摘要
我们提出 X-WAM(Unified 4D World Action Modeling),一种统一的 4D 世界模型,旨在在单个框架中统一实时机器人动作执行与高保真 4D 世界合成(视频 + 3D 重建),解决现有统一世界模型(如 UWM)仅建模 2D 像素空间且难以平衡动作效率与世界建模质量的关键限制。为了利用预训练视频扩散模型的强大视觉先验,X-WAM 通过预测多视角 RGB-D 视频来构想未来世界,并通过一种轻量级结构适应性高效获取空间信息:将预训练扩散 Transformer 的最后几层复制到专用的深度预测分支,用于重建未来空间信息。此外,我们提出了异步噪声采样(ANS)以联合优化生成质量和动作解码效率。ANS 在推理期间应用专门的异步去噪计划,通过更少的步骤快速解码动作以实现高效实时执行,同时专注于完整的步骤序列以生成高保真视频。虽然在训练期间不完全解耦时间步长,ANS 从其联合分布中采样以与推理分布对齐。在使用超过 5800 小时的机器人数据进行预训练后,X-WAM 在 RoboCasa 和 RoboTwin 2.0 基准测试中实现了 79.2% 和 90.7% 的平均成功率,同时在视觉和几何指标上超越现有方法,产生高保真的 4D 重建与合成。
引用
@article{arxiv.2604.26694,
title = {Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising},
author = {Jun Guo and Qiwei Li and Peiyan Li and Zilong Chen and Nan Sun and Yifei Su and Heyun Wang and Yuan Zhang and Xinghang Li and Huaping Liu},
journal= {arXiv preprint arXiv:2604.26694},
year = {2026}
}
备注
Project website: https://sharinka0715.github.io/X-WAM/