Waver:通过波浪方式生成逼真视频
计算机视觉与模式识别
2025-08-27 v2
摘要
我们提出 Waver,这是一个高性能的统一图像和视频生成基础模型。Waver 可直接生成持续时间为5至10秒、原生分辨率为720p的视频,随后升级到1080p。该模型同时支持文本到视频(T2V)、图像到视频(I2V)和文本到图像(T2I)生成,所有功能集成于单个框架中。我们引入 Hybrid Stream DiT 架构以增强模态对齐并加速训练收敛。为确保训练数据质量,我们建立了全面的数据清理管道,并手动标注并训练基于 MLLM 的视频质量模型以筛选最高质量的样本。此外,我们提供详细的训练和推理配方,以便生成高质量视频。基于这些贡献,Waver 在捕捉复杂运动方面表现突出,在视频合成中实现卓越的运动幅度和时间一致性。显著的是,它在人工分析(T2V 和 I2V)排行榜中名列前三,持续优于现有开源模型,甚至与最先进的商业解决方案相媲美。我们希望本技术报告能帮助社区更高效地训练高质量视频生成模型,加速视频生成技术的进展。官方页面:https://github.com/FoundationVision/Waver。
引用
@article{arxiv.2508.15761,
title = {Waver: Wave Your Way to Lifelike Video Generation},
author = {Yifu Zhang and Hao Yang and Yuqi Zhang and Yifei Hu and Fengda Zhu and Chuang Lin and Xiaofeng Mei and Yi Jiang and Bingyue Peng and Zehuan Yuan},
journal= {arXiv preprint arXiv:2508.15761},
year = {2025}
}