私有种子,公开大语言模型:实现真实且隐私保护的合成数据生成
密码学与安全
2026-04-14 v2 人工智能
摘要
大语言模型(LLM)已成为合成数据生成的强大工具。一个特别重要的用例是生成私有文本的合成副本,这需要在隐私和实用性之间进行仔细的权衡。我们提出了真实且隐私保护的合成数据生成(RPSG)方法,通过使用私有种子并集成隐私保护策略(包括在候选选择中采用正式的差分隐私机制)来生成逼真的合成数据。针对最新方法进行的全面实验表明,RPSG在保持高保真度私有数据方面取得佳绩,同时提供了强大的隐私保护。
引用
@article{arxiv.2604.07486,
title = {Private Seeds, Public LLMs: Realistic and Privacy-Preserving Synthetic Data Generation},
author = {Qian Ma and Sarah Rajtmajer},
journal= {arXiv preprint arXiv:2604.07486},
year = {2026}
}
备注
22 pages, 7 figures, 18 tables