关于生成模型评估的研究
机器学习
2022-06-23 v1 计算机视觉与模式识别
摘要
不返回似然值的隐式生成模型,如生成对抗网络和扩散模型,近年来已变得普遍。尽管这些模型确实展示了卓越的结果,但评估其性能具有挑战性。该问题对推动研究进展以及从随机噪声中识别有意义的增益至关重要。目前,诸如Inception分数(IS)和Frechet Inception Distance (FID)等启发式度量是最常见的评估指标,但它们所度量的内容并不完全清晰。此外,关于它们的分数实际意义如何也存在疑问。在这项工作中,我们通过生成一个高质量合成数据集来研究生成模型的评估指标,在该数据集上我们可以估计经典度量以进行比较。我们的研究表明,虽然FID和IS确实与若干f-散度相关,但它们对相近模型的排序可能差异很大,使得它们用于细粒度比较时存在问题。我们进一步使用该实验设置来研究哪种评估指标与我们的概率度量相关性最好。最后,我们考察了用于FID等度量的基础特征。
引用
@article{arxiv.2206.10935,
title = {A Study on the Evaluation of Generative Models},
author = {Eyal Betzalel and Coby Penso and Aviv Navon and Ethan Fetaya},
journal= {arXiv preprint arXiv:2206.10935},
year = {2022}
}
备注
13 pages