RealWonder:实时物理动作条件视频生成
计算机视觉与模式识别
2026-03-06 v1 人工智能
图形学
摘要
当前的视频生成模型无法模拟 3D 动作(如力量和机器人操作)的物理后果,因为它们缺乏对动作如何影响 3D 场景的结构性理解。我们提出 RealWonder,首个实现从单张图像进行动作条件视频生成的实时系统。我们的关键思想是将物理仿真作为中间桥梁:不直接编码连续动作,而是通过物理仿真转化为视频模型可处理的视觉表征(光流和 RGB)。RealWonder 集成三个组件:单图像 3D 重建、物理仿真以及只需 4 步扩散的蒸馏视频生成器。我们的系统在 480x832 分辨率下实现 13.2 FPS,使我们能够在刚性物体、可变形物体、流体和颗粒材料上进行交互式探索力量、机器人动作和相机控制。我们设想 RealWonder 为在沉浸式体验、AR/VR 和机器人学习中应用视频模型开辟了新的机遇。我们的代码和模型权重已公开于项目网站:https://liuwei283.github.io/RealWonder/
引用
@article{arxiv.2603.05449,
title = {RealWonder: Real-Time Physical Action-Conditioned Video Generation},
author = {Wei Liu and Ziyu Chen and Zizhang Li and Yue Wang and Hong-Xing Yu and Jiajun Wu},
journal= {arXiv preprint arXiv:2603.05449},
year = {2026}
}
备注
The first two authors contributed equally. The last two authors advised equally. Project website: https://liuwei283.github.io/RealWonder/