中文

TRIP:基于图像噪声先验的时间残差学习用于图像到视频扩散模型

计算机视觉与模式识别 2024-03-26 v1 多媒体

摘要

文本到视频生成的最新进展展示了强大扩散模型的效用。然而,将扩散模型改造为让静态图像动起来(即图像到视频生成)并非易事。其困难在于,后续动画帧的扩散过程不仅需要保持与给定图像的忠实对齐,还需追求相邻帧之间的时间连贯性。为缓解这一问题,我们提出了 TRIP,一种图像到视频扩散范式的新方案,其核心在于利用从静态图像导出的图像噪声先验,共同触发帧间关系推理,并通过时间残差学习 ease the coherent temporal modeling。在技术上,首先基于静态图像和带噪视频 latent codes 通过一步反向扩散过程获取图像噪声先验。接着,TRIP 执行一种类似残差的双路径方案进行噪声预测:1) 捷径路径,直接将图像噪声先验作为每帧的参考噪声,以增强第一帧与后续帧之间的对齐;2) 残差路径,在带噪视频和静态图像 latent codes 上使用 3D-UNet,实现帧间关系推理,从而 ease 每帧残差噪声的学习。此外,每帧的参考噪声和残差噪声通过注意力机制动态合并,用于最终的视频生成。在 WebVid-10M、DTDB 和 MSR-VTT 数据集上的大量实验证明了我们的 TRIP 在图像到视频生成中的有效性。请访问我们的项目页面 https://trip-i2v.github.io/TRIP/。

关键词

引用

@article{arxiv.2403.17005,
  title  = {TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models},
  author = {Zhongwei Zhang and Fuchen Long and Yingwei Pan and Zhaofan Qiu and Ting Yao and Yang Cao and Tao Mei},
  journal= {arXiv preprint arXiv:2403.17005},
  year   = {2024}
}

备注

CVPR 2024; Project page: https://trip-i2v.github.io/TRIP/