你的合成数据有多保真?用于评估与审计生成模型的样本级度量
机器学习
2022-07-14 v2 机器学习
摘要
设计领域无关且模型无关的 generative models(生成模型)评估度量是一个重要且尚未解决的问题。大多数现有度量专为图像合成设置定制,在诊断生成模型在更广泛应用领域中的不同失效模式方面能力有限。在本文中,我们引入了一个三维评估度量,(-Precision、-Recall、Authenticity),以领域无关的方式刻画任何生成模型的保真度、多样性和泛化性能。我们的度量将统计散度度量与精度-召回分析相统一,实现了对模型保真度和多样性的样本级与分布级诊断。我们引入泛化作为(保真度-多样性权衡之外的)一个独立的维度,量化模型复制训练数据的程度——当对具有隐私要求的敏感数据建模时,这是一个关键的性能指标。三个度量分量对应于(可解释的)概率量,并通过样本级二分类进行估计。我们度量的样本级特性启发了一种我们称之为模型审计的新用例,其中我们判断(黑盒)模型生成的单个样本的质量,丢弃低质量样本,从而以事后方式改善整体模型性能。
引用
@article{arxiv.2102.08921,
title = {How Faithful is your Synthetic Data? Sample-level Metrics for Evaluating and Auditing Generative Models},
author = {Ahmed M. Alaa and Boris van Breugel and Evgeny Saveliev and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2102.08921},
year = {2022}
}