Palette:图像到图像扩散模型
计算机视觉与模式识别
2022-05-05 v2 机器学习
摘要
本文基于条件扩散模型开发了一个统一的图像到图像翻译框架,并在四项具有挑战性的图像到图像翻译任务上评估该框架,即上色、修复、补全裁剪和JPEG恢复。我们对图像到图像扩散模型的简单实现在所有任务上均优于强大的GAN和回归基线,且无需任务特定的超参数调优、架构定制或任何辅助损失或复杂新技术。我们揭示了去噪扩散目标中L2与L1损失对样本多样性的影响,并通过实证研究表明了神经架构中自注意力的重要性。重要的是,我们倡导一种基于ImageNet的统一评估协议,结合人工评估和样本质量分数(FID、Inception Score、预训练ResNet-50的分类准确率以及与原始图像的感知距离)。我们期望这一标准化评估协议能在推动图像到图像翻译研究中发挥作用。最后,我们展示了一个通用的多任务扩散模型表现与或优于特定任务的专用对应模型。请访问https://diffusion-palette.github.io查看结果概览。
引用
@article{arxiv.2111.05826,
title = {Palette: Image-to-Image Diffusion Models},
author = {Chitwan Saharia and William Chan and Huiwen Chang and Chris A. Lee and Jonathan Ho and Tim Salimans and David J. Fleet and Mohammad Norouzi},
journal= {arXiv preprint arXiv:2111.05826},
year = {2022}
}