中文

SynthEval:用于细粒度实用性与隐私评估表格合成数据的框架

机器学习 2024-12-05 v1 性能

摘要

随着合成数据在解决机器学习中数据稀缺、数据公平性和数据隐私等当代问题方面的日益增长的需求,对于评估此类数据实用性和潜在隐私风险的稳健工具变得至关重要。SynthEval 是一个新颖的开源评估框架,与现有工具不同,它在不假设任何特殊预处理步骤的情况下,以平等的关注度对待分类属性和数值属性,这使其适用于几乎任何表格记录的合成数据集。我们的工具利用统计和机器学习技术来全面评估合成数据的保真度和隐私保护完整性。SynthEval 集成了广泛的度量标准,这些度量标准可以独立使用或以高度可定制的基准配置使用,并且可以轻松地与额外的度量标准集成。在本文中,我们描述了 SynthEval 并通过示例说明了其多样性。该框架促进了更好的基准测试和更一致的模型能力比较。

关键词

引用

@article{arxiv.2404.15821,
  title  = {SynthEval: A Framework for Detailed Utility and Privacy Evaluation of Tabular Synthetic Data},
  author = {Anton Danholt Lautrup and Tobias Hyrup and Arthur Zimek and Peter Schneider-Kamp},
  journal= {arXiv preprint arXiv:2404.15821},
  year   = {2024}
}