中文

FEST:合成表格数据评估的统一框架

机器学习 2025-08-25 v1

摘要

利用生成式机器学习技术的合成数据生成为缓解真实数据使用相关的隐私问题提供了一种有前景的方法。合成数据在保持强隐私保证的同时与真实数据高度相似。然而,在评估合成数据生成时,特别是考虑合成数据中隐私保护与数据效用之间的平衡时,仍然缺少一个全面的评估框架。本研究通过提出FEST——一个评估合成表格数据的系统性框架——来弥补这一空白。FEST整合了多种隐私指标(基于攻击的指标和基于距离的指标),以及相似性和机器学习效用指标,以提供全面的评估。我们将FEST开发为一个开源的基于Python的库,并在多个数据集上进行了验证,展示了其在分析不同合成数据生成模型的隐私-效用权衡方面的有效性。FEST的源代码可在Github上获取。

关键词

引用

@article{arxiv.2508.16254,
  title  = {FEST: A Unified Framework for Evaluating Synthetic Tabular Data},
  author = {Weijie Niu and Alberto Huertas Celdran and Karoline Siarsky and Burkhard Stiller},
  journal= {arXiv preprint arXiv:2508.16254},
  year   = {2025}
}

备注

11 pages, International Conference on Information Systems Security and Privacy