中文

SynQP:评估合成数据质量与隐私风险的框架与指标

机器学习 2026-01-21 v1 人工智能

摘要

合成数据在健康应用中的使用引发了隐私担忧,然而缺乏用于隐私评估的开放框架减缓了其采用。一个主要挑战是,由于获取敏感数据的困难,缺乏用于评估隐私风险的可访问基准数据集。为了解决这个问题,我们引入了 SynQP,一个使用模拟敏感数据对合成数据生成(SDG)进行隐私基准测试的开放框架,确保原始数据保持机密。我们还强调了需要能够公平地考虑机器学习模型概率性质的隐私指标。作为演示,我们使用 SynQP 对 CTGAN 进行基准测试,并提出了一种新的身份披露风险指标,与现有方法相比,该指标能更准确地估计隐私风险。我们的工作为提高隐私评估的透明度和可靠性提供了一个关键工具,从而能够在健康相关应用中更安全地使用合成数据。在我们的质量评估中,非隐私模型达到了近乎完美的机器学习效能 0.97\ge0.97。我们的隐私评估(表 II)显示,差分隐私(DP)持续降低了身份披露风险(SD-IDR)和成员推断攻击风险(SD-MIA),所有经过 DP 增强的模型都保持在 0.09 的监管阈值以下。代码可在 https://github.com/CAN-SYNH/SynQP 获取。

关键词

引用

@article{arxiv.2601.12124,
  title  = {SynQP: A Framework and Metrics for Evaluating the Quality and Privacy Risk of Synthetic Data},
  author = {Bing Hu and Yixin Li and Asma Bahamyirou and Helen Chen},
  journal= {arXiv preprint arXiv:2601.12124},
  year   = {2026}
}

备注

7 Pages, 22nd Annual International Conference on Privacy, Security, and Trust (PST2025), Fredericton, Canada