全变差距离的判别式估计:生成数据的保真度审计器
机器学习
2024-05-27 v1 机器学习
摘要
随着生成式AI的普及和生成数据(也称为合成数据)数量的增加,评估生成数据的保真度已成为一个关键问题。在本文中,我们提出了一种判别式方法来估计两个分布之间的全变差(TV)距离,作为生成数据保真度的有效度量。我们的方法定量刻画了分类两个分布时的贝叶斯风险与其TV距离之间的关系。因此,全变差距离的估计简化为贝叶斯风险的估计。特别地,本文建立了关于两个高斯分布之间TV距离估计误差收敛速度的理论结果。我们证明,通过选择特定的分类假设类,可以在估计TV距离时实现快速收敛速度。具体来说,TV距离的估计精度被证明固有地依赖于两个高斯分布的分离程度:当两个高斯分布相距越远时,估计误差越小。这一现象也通过大量模拟得到了经验验证。最后,我们将这种判别式估计方法应用于使用MNIST数据集对合成图像数据的保真度进行排序。
引用
@article{arxiv.2405.15337,
title = {Discriminative Estimation of Total Variation Distance: A Fidelity Auditor for Generative Data},
author = {Lan Tao and Shirong Xu and Chi-Hua Wang and Namjoon Suh and Guang Cheng},
journal= {arXiv preprint arXiv:2405.15337},
year = {2024}
}