类别生成模型评估——弥合真实与合成数据之间的鸿沟
机器学习
2022-11-01 v1
摘要
机器学习界主要依赖真实数据来基准测试算法,因为真实数据能提供模型适用性的有力证据。在合成数据集上的评估可以成为更好地理解模型优势、劣势和整体能力的强大工具。获取这些洞察对生成建模尤为重要,因为目标量完全未知。文献中已报道了与生成模型评估相关的多个问题。我们认为,基于真实基线的评估可避免这些问题。对合成实验的普遍批评是它们过于简化且不能代表实际场景。因此,我们的实验设置针对一个现实生成任务。我们聚焦于类别数据并引入一种适当可扩展的评估方法。我们的方法要求生成模型在高维设定下学习一个分布。随后我们逐步对大空间分箱,以获得可应用有意义统计检验的较小概率空间。我们考虑逐渐增大的概率空间,对应逐渐困难的建模任务,并基于生成模型在被检测为偏离真实基线过远前所能达到的最高任务难度进行比较。我们通过针对合成生成模型和当前最先进(SOTA)类别生成模型的合成实验验证了我们的评估流程。
引用
@article{arxiv.2210.16405,
title = {Evaluation of Categorical Generative Models -- Bridging the Gap Between Real and Synthetic Data},
author = {Florence Regol and Anja Kroon and Mark Coates},
journal= {arXiv preprint arXiv:2210.16405},
year = {2022}
}
备注
Submitted to the 2023 International Conference on Acoustics, Speech, and Signal Processing (ICASSP). June 2023. 5 pages, 4 figures