中文

评估差分隐私生成的领域特定文本

机器学习 2025-09-01 v1 人工智能 密码学与安全

摘要

生成式 AI 在医疗和金融等高风险领域展现出变革性潜力,但隐私与监管障碍阻碍了真实数据的使用。为此,差分隐私合成数据生成已成为有前景的替代方案。本文引入统一基准,系统评估在形式差分隐私保证下生成的文本数据集的实用性与保真度。我们的基准涵盖领域特定基准测试的关键挑战,包括代表性数据选择、现实隐私预算、预训练过程以及多种评估指标。我们对比评估了最新隐私保护生成方法在五个领域特定数据集上的表现,发现相较于真实数据,在严格隐私约束下,这些方法在实用性和保真度方面存在显著下降。这凸显了当前方法的局限性,概述了需要发展的先进隐私保护数据共享方法,并在现实情境下为其评估树立了先例。

关键词

引用

@article{arxiv.2508.20452,
  title  = {Evaluating Differentially Private Generation of Domain-Specific Text},
  author = {Yidan Sun and Viktor Schlegel and Srinivasan Nandakumar and Iqra Zahid and Yuping Wu and Warren Del-Pinto and Goran Nenadic and Siew-Kei Lam and Jie Zhang and Anil A Bharath},
  journal= {arXiv preprint arXiv:2508.20452},
  year   = {2025}
}