图像生成多样性问题及其解决方案
计算机视觉与模式识别
2024-12-13 v2
摘要
生成方法现在能够产生几乎 indistinguishable于真实数据的输出,但往往未能完全捕捉数据分布。与质量问题不同,生成模型中的多样性受限在视觉上难以检测,需要特定的指标进行评估。本文通过将多样性定义为图像检索问题来关注当前生成模型中多样性不足以及常见指标无法衡量此问题。我们通过以合成数据作为查询检索多少真实图像来实现这一点。这产生了图像检索分数(IRS),这是一种可解释、无超参数的指标,用于量化生成模型输出的多样性。IRS仅需要一部分合成样本即可提供置信水平的统计衡量标准。我们的实验表明,当前常用于生成模型评估的特征提取器不足以有效评估多样性。因此,我们对寻找最佳特征提取器以评估多样性进行了广泛搜索。评估结果表明,当前扩散模型收敛到数据分布的有限子集,没有任何当前最先进的模型超越 77% 的训练数据多样性。为了解决这一限制,我们提出了多样性感知扩散模型(DiADM),这是一种新方法,用于在不损失图像质量的前提下提高无条件扩散模型的多样性。我们通过使用一种多样性感知模块来分离多样性与图像质量,该模块以伪无条件特征作为输入。我们提供了一个 Python 软件包,提供统一的特征提取和指标计算,以进一步促进生成模型的评估 https://github.com/MischaD/beyondfid。
引用
@article{arxiv.2411.16171,
title = {Image Generation Diversity Issues and How to Tame Them},
author = {Mischa Dombrowski and Weitong Zhang and Sarah Cechnicka and Hadrien Reynaud and Bernhard Kainz},
journal= {arXiv preprint arXiv:2411.16171},
year = {2024}
}
备注
17 pages, 6 tables, 12 figures; v2 added acknowledgment