CHIMLE:用于多模态条件图像合成的条件式分层 IMLE
计算机视觉与模式识别
2023-02-07 v2 机器学习
摘要
条件图像合成中一个长期的挑战是,尽管每个输入图像仅观测到一张输出图像,仍要从同一输入图像生成多样的输出图像。基于 GAN 的方法容易出现模式崩溃,导致多样性低。为规避此问题,我们利用隐式最大似然估计(IMLE),其可从根本上克服模式崩溃。IMLE 使用与 GAN 相同的生成器,但以不同的非对抗目标进行训练,确保每个观测图像附近都有生成的样本。遗憾的是,为生成高保真图像,先前基于 IMLE 的方法需要大量样本,代价高昂。在本文中,我们提出一种绕过该限制的新方法,称之为条件式分层 IMLE(CHIMLE),其无需大量样本即可生成高保真图像。我们表明,在夜景转日景、16 倍单图像超分辨率、图像上色与图像解压缩四项任务中,CHIMLE 在图像保真度与模式覆盖上显著优于先前最佳的 IMLE、GAN 与扩散方法。定量上,与先前最佳基于 IMLE 的方法相比,我们的方法将 Fréchet Inception Distance(FID)平均提升 36.9%,与最佳非 IMLE 类通用方法相比平均提升 27.5%。
引用
@article{arxiv.2211.14286,
title = {CHIMLE: Conditional Hierarchical IMLE for Multimodal Conditional Image Synthesis},
author = {Shichong Peng and Alireza Moazeni and Ke Li},
journal= {arXiv preprint arXiv:2211.14286},
year = {2023}
}
备注
More results and code are available on the project website at https://niopeng.github.io/CHIMLE/