ScalingNoise: 扩展推理时搜索以生成无限长视频
机器学习
2025-05-27 v3
摘要
视频扩散模型(VDMs)促进了高质量视频的生成,当前研究主要集中在通过改进数据质量、计算资源和模型复杂性来扩展训练阶段的工作。然而,推理时扩展较少受到关注,大多数方法将模型限制为单次生成尝试。近期研究发现了“黄金噪声”的存在,可以在生成过程中提升视频质量。在此基础上,我们发现引导 VDMs 的推理时搜索扩展以识别更好的噪声候选,不仅能评估当前步骤生成帧的质量,还能通过参考先前多个分块的锚帧来保留高层目标特征,从而提供长期价值。我们的分析表明,扩散模型本身具备通过改变去噪步数来灵活调整计算的能力,即使在奖励信号引导下采用单步去噪方法,也能产生显著的长期收益。基于这一观察,我们提出了 ScalingNoise,一种即插即用的推理时搜索策略,用于识别扩散采样过程中的黄金初始噪声,以改善全局内容一致性和视觉多样性。具体而言,我们执行单步去噪将初始噪声转换为视频片段,随后利用以先前生成内容为锚点的奖励模型评估其长期价值。此外,为保持多样性,我们从一个对有前景的噪声赋予更高权重的倾斜噪声分布中采样候选噪声。通过这种方式,ScalingNoise 显著减少了噪声引起的误差,确保了更加连贯且时空一致的视频生成。在基准数据集上的大量实验表明,所提出的 ScalingNoise 能有效改善长视频生成。
引用
@article{arxiv.2503.16400,
title = {ScalingNoise: Scaling Inference-Time Search for Generating Infinite Videos},
author = {Haolin Yang and Feilong Tang and Ming Hu and Qingyu Yin and Yulong Li and Yexin Liu and Zelin Peng and Peng Gao and Junjun He and Zongyuan Ge and Imran Razzak},
journal= {arXiv preprint arXiv:2503.16400},
year = {2025}
}