中文

用于评估隐式生成模型的核化 Stein 统计量

机器学习 2022-06-02 v1 机器学习

摘要

合成数据生成已成为训练机器学习流程的关键要素,用于解决数据增强、分析隐私敏感数据或可视化代表性样本等任务。因此必须解决此类合成数据生成器质量评估问题。由于用于合成数据的(深度)生成模型通常不给出显式概率分布,评估模型拟合优度的经典统计流程可能不适用。本文提出一种评估合成数据生成器质量的规范性流程。该流程是一种核化 Stein 差异(KSD)型检验,基于针对目标合成数据生成器的非参数 Stein 算子。该算子从合成数据生成器获得的样本中估计,因此即使模型仅为隐式也可应用。与经典检验不同,来自合成数据生成器的样本量可任意大,而生成器旨在模拟的观测数据量则是固定的。在合成分布以及合成与真实数据集上训练的生成模型上的实验结果表明,与现有方法相比,该方法具有更优的检验功效。

关键词

引用

@article{arxiv.2206.00149,
  title  = {A Kernelised Stein Statistic for Assessing Implicit Generative Models},
  author = {Wenkai Xu and Gesine Reinert},
  journal= {arXiv preprint arXiv:2206.00149},
  year   = {2022}
}