中文

FastInit:用于实现视频生成时程一致性的快速噪声初始化方法

计算机视觉与模式识别 2025-08-06 v1 人工智能

摘要

视频生成已取得显著进展,尤其是基于扩散模型的发展,但实现高时序一致性仍是具有挑战性的任务。最近,FreeInit 通过识别训练-推理之间的差距,提出一种方法在推理期间迭代细化初始噪声。然而,迭代细化显著增加了视频生成过程的计算成本。本文引入 FastInit,一种快速噪声初始化方法,无需进行迭代细化。FastInit 学习一个视频噪声预测网络(VNPNet),该网络以随机噪声和文本提示作为输入,生成经过单次前向传播细化的噪声。因此,FastInit 在实现高时序一致性的同时,大幅提升了视频生成的效率。为训练 VNPNet,我们构建了一个大型数据集,包含文本提示、随机噪声和细化后噪声的配对。对 various text-to-video 模型进行大量实验,结果表明该方法始终提高了生成视频的质量和时序一致性。FastInit 不仅为视频生成提供了显著的改进,还提供一种可直接应用于推理阶段的实用解决方案。代码和数据集将对外公开发布。

关键词

引用

@article{arxiv.2506.16119,
  title  = {FastInit: Fast Noise Initialization for Temporally Consistent Video Generation},
  author = {Chengyu Bai and Yuming Li and Zhongyu Zhao and Jintao Chen and Peidong Jia and Qi She and Ming Lu and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2506.16119},
  year   = {2025}
}