中文

揭示生成模型评估指标的缺陷及其对扩散模型的不公平对待

机器学习 2023-12-06 v2 计算机视觉与模式识别 机器学习

摘要

我们系统地研究了一系列涵盖语义多样图像数据集的各类生成模型,以理解并改进用于评估它们的特征提取器与指标。利用心理物理学中的最佳实践,我们通过开展迄今为止规模最大的生成模型评估实验,测量了人类对生成样本图像真实感的感知,发现现有指标均无法与人类评估强相关。对比用于评估生成模型整体性能、保真度、多样性、稀有度与记忆化的17种现代指标,我们发现人类所判定的扩散模型最先进的感知真实感并未在FID等常用报告指标中体现。该差异无法由生成样本的多样性解释,但其一个成因是对Inception-V3的过度依赖。我们通过研究替代的自监督特征提取器来解决这些缺陷,发现单个网络编码的语义信息强烈依赖于其训练过程,并表明DINOv2-ViT-L/14能够对生成模型进行更丰富的评估。接下来,我们调查数据记忆化,发现生成模型在CIFAR10等简单、较小数据集上确实记忆训练样本,但在ImageNet等更复杂数据集上未必如此。然而,我们的实验表明当前指标无法正确检测记忆化:文献中没有任何指标能够将记忆化与欠拟合或模式收缩等其他现象区分开。为促进生成模型及其评估的进一步发展,我们在 https://github.com/layer6ai-labs/dgm-eval 发布了所有生成图像数据集、人类评估数据以及一个用于计算9种不同编码器下17种常用指标的模块化库。

关键词

引用

@article{arxiv.2306.04675,
  title  = {Exposing flaws of generative model evaluation metrics and their unfair treatment of diffusion models},
  author = {George Stein and Jesse C. Cresswell and Rasa Hosseinzadeh and Yi Sui and Brendan Leigh Ross and Valentin Villecroze and Zhaoyan Liu and Anthony L. Caterini and J. Eric T. Taylor and Gabriel Loaiza-Ganem},
  journal= {arXiv preprint arXiv:2306.04675},
  year   = {2023}
}

备注

NeurIPS 2023. 53 pages, 29 figures, 12 tables. Code at https://github.com/layer6ai-labs/dgm-eval, reviews at https://openreview.net/forum?id=08zf7kTOoh