Wan:开放且先进的大规模视频生成模型
计算机视觉与模式识别
2025-04-22 v2
摘要
本报告介绍了Wan,一个全面且开放的视频基础模型套件,旨在突破视频生成的边界。基于主流的扩散Transformer范式,Wan通过一系列创新在生成能力上取得了显著进步,包括我们新颖的VAE、可扩展的预训练策略、大规模数据整理和自动化评估指标。这些贡献共同增强了模型的性能和多功能性。具体而言,Wan具有四个关键特征:领先性能:Wan的14B模型在包含数十亿图像和视频的大规模数据集上训练,展示了视频生成在数据和模型规模上的缩放定律。它在多个内部和外部基准测试中持续优于现有的开源模型以及最先进的商业解决方案,展现出明显且显著的性能优势。全面性:Wan提供了两个有能力的模型,即1.3B和14B参数,分别用于效率和效果。它还涵盖了多个下游应用,包括图像到视频、指令引导的视频编辑和个性化视频生成,涵盖多达八项任务。消费级效率:1.3B模型表现出卓越的资源效率,仅需8.19 GB显存,使其兼容广泛的消费级GPU。开放性:我们开源了整个Wan系列,包括源代码和所有模型,旨在促进视频生成社区的发展。这种开放性力求显著扩展行业中视频制作的创意可能性,并为学术界提供高质量的视频基础模型。所有代码和模型可在https://github.com/Wan-Video/Wan2.1获取。
引用
@article{arxiv.2503.20314,
title = {Wan: Open and Advanced Large-Scale Video Generative Models},
author = {Team Wan and Ang Wang and Baole Ai and Bin Wen and Chaojie Mao and Chen-Wei Xie and Di Chen and Feiwu Yu and Haiming Zhao and Jianxiao Yang and Jianyuan Zeng and Jiayu Wang and Jingfeng Zhang and Jingren Zhou and Jinkai Wang and Jixuan Chen and Kai Zhu and Kang Zhao and Keyu Yan and Lianghua Huang and Mengyang Feng and Ningyi Zhang and Pandeng Li and Pingyu Wu and Ruihang Chu and Ruili Feng and Shiwei Zhang and Siyang Sun and Tao Fang and Tianxing Wang and Tianyi Gui and Tingyu Weng and Tong Shen and Wei Lin and Wei Wang and Wei Wang and Wenmeng Zhou and Wente Wang and Wenting Shen and Wenyuan Yu and Xianzhong Shi and Xiaoming Huang and Xin Xu and Yan Kou and Yangyu Lv and Yifei Li and Yijing Liu and Yiming Wang and Yingya Zhang and Yitong Huang and Yong Li and You Wu and Yu Liu and Yulin Pan and Yun Zheng and Yuntao Hong and Yupeng Shi and Yutong Feng and Zeyinzi Jiang and Zhen Han and Zhi-Fan Wu and Ziyu Liu},
journal= {arXiv preprint arXiv:2503.20314},
year = {2025}
}
备注
60 pages, 33 figures