立场:当前所有生成式保真度与多样性度量指标均存在缺陷
机器学习
2025-05-29 v1
摘要
任何方法的开发与实际应用都受限于我们衡量其可靠性的能力。生成式建模的流行凸显了优秀的合成数据度量指标的重要性。遗憾的是,先前的研究发现了当前度量指标中的许多失败案例,例如缺乏异常值鲁棒性以及上下界不明确。我们提出了一系列针对合成数据度量指标的期望属性,以及一套合理性检验:精心挑选的简单实验,旨在检测特定且已知的生成式建模失败模式。基于这些期望属性和我们的检验结果,我们得出以下立场:当前所有生成式保真度与多样性度量指标均存在缺陷。这严重阻碍了合成数据的实际应用。我们的目的是说服研究社区在开发度量指标上投入更多精力,而非仅仅开发模型。此外,通过分析当前度量指标如何失效,我们为从业者提供了关于如何(不)使用这些度量指标的指南。
引用
@article{arxiv.2505.22450,
title = {Position: All Current Generative Fidelity and Diversity Metrics are Flawed},
author = {Ossi Räisä and Boris van Breugel and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2505.22450},
year = {2025}
}
备注
ICML 2025