中文

一次传递不够:基于递归潜在细化的生成模型

计算机视觉与模式识别 2026-05-18 v1

摘要

尽管取得了显著进展,图像生成仍远未解决。主导指标 FID 将样本保真度与模式覆盖度混合在一起,且已接近饱和。然而,模型仍可能出现模式坍缩,尽管实现了低 FID,因为少数锐利且近乎重复的图像可以超越那些忠实地覆盖完整数据分布的模型。我们认为,精度和召回率是 FID 的 essential 补充品,由于 FID 已饱和,更有意义的目标是提高多样性和覆盖度。实现高召回率需要一个显式优先考虑模式覆盖度的模型,而大多数生成模型则优化样本保真度。我们提出了 RTM,用迭代细化过程取代风格基生成器中的单次潜在映射,表明这一致性地提高了质量和多样性。集成基于隐式最大似然估计(IMLE)的模型,该方法以设计方式优化模式覆盖度,RTM 在当前最先进方法中实现了最高的精度和召回率,同时保持有竞争力的 FID,在 CIFAR-10、CelebA-HQ 256x256 以及九个 few-shot 基准测试中均取得改进。RTM 也提高了在 CIFAR-10 和 AFHQ-v1 512x512 上的 StyleGAN2 和 StyleGAN2-ADA 的性能,表明该好处不仅限于 IMLE。与牺牲覆盖度即可实现竞争 FID 的流匹配基线不同,递归细化同时提高了质量和多样性。

关键词

引用

@article{arxiv.2605.15309,
  title  = {One Pass Is Not Enough: Recursive Latent Refinement for Generative Models},
  author = {Mehdi Esmaeilzadeh and Alexia Jolicoeur-Martineau and Chirag Vashist and Ke Li},
  journal= {arXiv preprint arXiv:2605.15309},
  year   = {2026}
}