SinFusion:在单张图像或视频上训练扩散模型
计算机视觉与模式识别
2023-06-21 v3 机器学习
摘要
扩散模型在图像和视频生成方面取得了巨大进展,在质量和多样性上超越了 GAN。然而,它们通常在非常大规模的数据集上训练,并不能自然适应于对给定输入图像或视频进行操作。在本文中,我们展示了如何通过在单张输入图像或视频上训练扩散模型来解决这一问题。我们的图像/视频特定扩散模型(SinFusion)学习单张图像或视频的外观与动态,同时利用扩散模型的条件生成能力。它可以解决大量图像/视频特定的操作任务。特别地,我们的模型可以从少量帧中学习单个输入视频的运动与动态。随后它可以生成同一动态场景的多样新视频样本,将短视频向前和向后外推为长视频,并执行视频上采样。这些任务大多无法由当前特定的视频生成方法实现。
引用
@article{arxiv.2211.11743,
title = {SinFusion: Training Diffusion Models on a Single Image or Video},
author = {Yaniv Nikankin and Niv Haim and Michal Irani},
journal= {arXiv preprint arXiv:2211.11743},
year = {2023}
}
备注
Project Page: https://yanivnik.github.io/sinfusion