minWM:面向实时交互视频世界模型的全栈开源框架
计算机视觉与模式识别
2026-05-29 v1
摘要
最近的视频扩散基础模型在高质量视频生成方面取得了显著进展,但将其转化为实时交互式视频世界模型仍面临挑战。交互式世界模型需要可控、因果且低延迟的rollout,这在实践中需要涵盖数据构建、可控微调、自回归训练、少步蒸馏和流式推理的全链路管道。本文提出minWM,一个用于构建实时交互式视频世界模型的全栈开源框架。minWM提供一个端到端管道,将现有的双向T2V/TI2V视频基础模型转换为具有相机可控性的少步自回归世界模型。具体而言,minWM首先对带有相机控制的双向视频扩散模型进行微调,然后应用Causal Forcing/Causal Forcing++管道,包括AR扩散训练、因果ODE或因果一致性蒸馏以及非对称DMD,以将其蒸馏为用于低延迟rollout的少步自回归生成器。该框架模块化且可扩展:我们在代表性开源 backbone 上进行实例化,包括Wan2.1-T2V-1.3B和HY1.5-TI2V-8B,涵盖基于跨注意力的条件注入和MMDiT架构。minWM还支持将现有的视频世界模型(如HY-WorldPlay)适配到新的数据分布、训练配方和延迟目标。除了发布可运行的脚本、模型 checkpoint、文档和推理代码外,我们提供关于相机轨迹质量、可控性训练步数和最小 batch 大小要求的实用消融实验。我们希望minWM能作为构建和适配实时交互式视频世界模型的可复现且可扩展的配方。项目页面:[https://github.com/shengshu-ai/minWM](https://github.com/shengshu-ai/minWM)
引用
@article{arxiv.2605.30263,
title = {minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models},
author = {Min Zhao and Hongzhou Zhu and Bokai Yan and Zihan Zhou and Yimin Chen and Wenqiang Sun and Kaiwen Zheng and Guande He and Xiao Yang and Chongxuan Li and Fan Bao and Jun Zhu},
journal= {arXiv preprint arXiv:2605.30263},
year = {2026}
}