你的图像其实是伪视频的最后一帧
计算机视觉与模式识别
2025-09-15 v3 机器学习
摘要
扩散模型可视为分层变分自编码器(HVAEs)的特例,其在生成逼真图像方面取得了巨大成功。相比之下,标准HVAEs生成的图像质量通常不如扩散模型。本文假设扩散模型的成功可部分归因于由损坏图像提供的中间潜在状态的额外自监督信息,这些损坏图像与原始图像共同构成一个伪视频。基于此假设,我们探索了利用此类伪视频改进其他类型生成模型的可能性。具体来说,我们首先将给定的图像生成模型扩展为其视频生成模型对应物,然后在通过对原始图像应用数据增强构建的伪视频上训练该视频生成模型。此外,我们分析了扩散模型中常用的一阶马尔可夫数据增强方法的潜在问题,并提出使用更具表现力的数据增强来在伪视频中构建更有用的信息。我们在CIFAR10和CelebA数据集上的实验结果表明,通过伪视频提供的额外自监督信息可以实现更好的图像生成质量。
引用
@article{arxiv.2410.20158,
title = {Your Image is Secretly the Last Frame of a Pseudo Video},
author = {Wenlong Chen and Wenlin Chen and Lapo Rastrelli and Yingzhen Li},
journal= {arXiv preprint arXiv:2410.20158},
year = {2025}
}
备注
Presented at the ICLR 2025 Workshop on Deep Generative Model in Machine Learning: Theory, Principle and Efficacy (DeLTa). 1-frame results for CIFAR10 in Table 2 corrected. Code released