IV-Mixed 采样器: 利用图像扩散模型提升视频合成
计算机视觉与模式识别
2024-10-10 v2 人工智能
摘要
多步采样机制是视觉扩散模型的关键特性,其在通过增加推理计算成本来提升性能方面具有显著潜力,可复制 OpenAI 的 Strawberry 成功经验。充分的先前研究表明,正确地放大采样过程中的计算量可成功导致更高的生成质量、增强的图像编辑和组合泛化。虽然在开发推理计算密集型算法以提高图像生成性能方面取得了快速进展,但相对较少的工作探索了视频扩散模型(VDMs)的推理规模。此外,现有研究仅显示对肉眼可感知的最小性能提升。为此,我们设计了一种新型无训练算法 IV-Mixed 采样器,利用图像扩散模型(IDMs)的优势帮助 VDMs 超越其当前能力。IV-Mixed 采样器的核心在于使用 IDMs 大幅提升每个视频帧的质量,而 VDMs 在采样过程中确保视频的时序一致性。我们的实验表明,IV-Mixed 采样器在 4 个基准测试中实现了最先进的性能,包括 UCF-101-FVD、MSR-VTT-FVD、Chronomagic-Bench-150 和 Chronomagic-Bench-1649。例如,使用 IV-Mixed 采样器的开源 Animatediff 将 UMT-FVD 分数从 275.2 降至 228.6,接近闭源 Pika-2.0 的 223.1。
引用
@article{arxiv.2410.04171,
title = {IV-Mixed Sampler: Leveraging Image Diffusion Models for Enhanced Video Synthesis},
author = {Shitong Shao and Zikai Zhou and Lichen Bai and Haoyi Xiong and Zeke Xie},
journal= {arXiv preprint arXiv:2410.04171},
year = {2024}
}