SANA-WM:基于混合线性扩散 Transformer 的高效分钟级世界建模
计算机视觉与模式识别
2026-05-15 v1
摘要
我们提出 SANA-WM,一款 2.6B 参数的高效开源世界模型,专为一分钟生成而设计,能够合成高保真、720p、分钟级视频,实现精确的相机控制。SANA-WM 在视觉质量上与 LingBot-World 和 HY-WorldPlay 等大规模工业基线相当,同时显著提升了效率。四项核心设计驱动我们的架构:(1) 混合线性注意力将帧级 Gated DeltaNet (GDN) 与 softmax 注意力结合,实现内存高效的长程建模。(2) 双分支相机控制确保精确的 6 自由度轨迹遵循。(3) 两阶段生成管道应用长视频精炼器对阶段-1 输出进行处理,提高跨序列的质量和一致性。(4) 稳健标注管道从公开视频中提取准确的尺度 6 自由度相机姿态,以获得高质量、时空一致的动作标签。凭借这些设计,SANA-WM 在数据、训练计算和推理硬件方面展现了惊人的效率:仅使用约 21.3 万个带尺度姿态监督的公开视频片段,训练在 64 个 H100 上完成 15 天,生成每个 60 秒片段只需单个 GPU;其蒸馏变体可在单个 RTX 5090 上使用 NVFP4 量化,在 34 秒内生成 60 秒 720p 视频。在我们的分钟级世界模型基准测试中,SANA-WM 在动作跟随精度上优于先前的开源基线,并以 的更高吞吐量实现了与工业基线相当的视觉质量,实现可扩展的世界建模。
引用
@article{arxiv.2605.15178,
title = {SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer},
author = {Haoyi Zhu and Haozhe Liu and Yuyang Zhao and Tian Ye and Junsong Chen and Jincheng Yu and Tong He and Song Han and Enze Xie},
journal= {arXiv preprint arXiv:2605.15178},
year = {2026}
}
备注
https://nvlabs.github.io/Sana/WM/