评估合成数据效用的密度比框架
机器学习
2024-08-26 v1 机器学习
摘要
合成数据生成是一种有前景的技术,可在降低隐私泄露风险的同时促进敏感数据的使用。然而,要使合成数据在下游分析任务中有用,其质量必须足够高。已有多种方法被提出用于衡量合成数据的效用,但其结果往往不完整甚至具有误导性。本文提出使用密度比估计来改进合成数据的质量评估,进而提升合成数据集的质量。我们展示了该框架如何与现有度量方法相关联并在此基础上构建,从而产生信息丰富且易于解释的全局和局部效用度量。我们开发了一种估计器,由于能够自动选择非参数密度比模型,因此几乎不需要手动调整。通过模拟实验,我们发现密度比估计在全局效用估计上比已有方法更准确。一项真实世界数据应用展示了密度比如何指导合成模型的改进,并可用于改进下游分析。我们得出结论,密度比估计是合成数据生成工作流程中的一个有价值工具,并将这些方法以开源R包densityratio的形式提供,便于使用。
引用
@article{arxiv.2408.13167,
title = {A density ratio framework for evaluating the utility of synthetic data},
author = {Thom Benjamin Volker and Peter-Paul de Wolf and Erik-Jan van Kesteren},
journal= {arXiv preprint arXiv:2408.13167},
year = {2024}
}