评估高风险领域中差分隐私合成数据生成的效果
计算与语言
2024-10-14 v1
摘要
anonymizing 文本数据(文本数据匿名化)的困难阻碍了医疗和社会服务等涉及私人数据的高风险领域中自然语言处理(NLP)的开发和部署。 poorly anonymized 的敏感数据无法轻易与标注者或外部研究者共享,也无法用于训练公共模型。本文探讨了是否可以使用来自差分隐私语言模型生成的合成数据,以取代真实数据,从而在不损害隐私的前提下促进这些领域中 NLP 的开发。与先前工作不同,本文为真实高风险领域生成合成数据,并提出并进行了以实际应用为导向的评估,以衡量数据质量。我们的结果表明,先前的简单评估未能揭示合成数据中的实用性、隐私性和公平性问题。总体而言,本工作凸显了需要进一步改进合成数据生成才能成为一种可行的隐私保留数据共享方式。
引用
@article{arxiv.2410.08327,
title = {Evaluating Differentially Private Synthetic Data Generation in High-Stakes Domains},
author = {Krithika Ramesh and Nupoor Gandhi and Pulkit Madaan and Lisa Bauer and Charith Peris and Anjalie Field},
journal= {arXiv preprint arXiv:2410.08327},
year = {2024}
}
备注
Accepted to EMNLP 2024 (Findings)