用于竞赛的合成数据质量度量
机器学习
2018-07-02 v1 机器学习
摘要
机器学习有潜力协助许多社群利用日益可得的大型数据集。遗憾的是,这一潜力大多未能实现,因为其需要以损害隐私的方式共享数据。为克服这一障碍,已有若干方法被提出,可在保留真实数据隐私的同时生成合成数据。在本文中,我们考虑合成数据若要对数机器学习研究者有用所应具备的一个关键特征——两种算法在合成数据集上(经训练与测试后)的相对性能,应与其在原始数据集上(经训练与测试后)的相对性能相同。
引用
@article{arxiv.1806.11345,
title = {Measuring the quality of Synthetic data for use in competitions},
author = {James Jordon and Jinsung Yoon and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:1806.11345},
year = {2018}
}
备注
3 pages, 1 figure, 2018 KDD Workshop on Machine Learning for Medicine and Healthcare