中文

STIV:可扩展的文本与图像条件视频生成

计算机视觉与模式识别 2025-10-07 v2 人工智能 机器学习 多媒体

摘要

视频生成领域取得了显著进展,但仍迫切需要一种清晰、系统的方法来指导稳健且可扩展模型的开发。在这项工作中,我们提出了一项全面的研究,系统地探索了模型架构、训练策略和数据管理策略之间的相互作用,最终形成了一种简单且可扩展的文本-图像条件视频生成方法,命名为 STIV。我们的框架通过帧替换将图像条件集成到扩散 Transformer (DiT) 中,同时通过联合图像-文本条件无分类器引导融入文本条件。这种设计使 STIV 能够同时执行文本到视频 (T2V) 和文本-图像到视频 (TI2V) 任务。此外,STIV 可以轻松扩展到各种应用,例如视频预测、帧插值、多视图生成和长视频生成等。通过在 T2I、T2V 和 TI2V 上的全面消融研究,STIV 尽管设计简单,却展现出强大的性能。一个 8.7B 参数、分辨率为 512 的模型在 VBench T2V 上达到 83.1 分,超越了领先的开源和闭源模型,如 CogVideoX-5B、Pika、Kling 和 Gen-3。同等规模的模型在分辨率为 512 的 VBench I2V 任务上也取得了 90.1 分的领先结果。通过为构建前沿视频生成模型提供透明且可扩展的方案,我们旨在赋能未来研究,并加速向更通用、更可靠的视频生成解决方案迈进。

关键词

引用

@article{arxiv.2412.07730,
  title  = {STIV: Scalable Text and Image Conditioned Video Generation},
  author = {Zongyu Lin and Wei Liu and Chen Chen and Jiasen Lu and Wenze Hu and Tsu-Jui Fu and Jesse Allardice and Zhengfeng Lai and Liangchen Song and Bowen Zhang and Cha Chen and Yiran Fei and Lezhi Li and Yizhou Sun and Kai-Wei Chang and Yinfei Yang},
  journal= {arXiv preprint arXiv:2412.07730},
  year   = {2025}
}