中文

私有种子,公开大语言模型:实现真实且隐私保护的合成数据生成

密码学与安全 2026-04-14 v2 人工智能

摘要

大语言模型(LLM)已成为合成数据生成的强大工具。一个特别重要的用例是生成私有文本的合成副本,这需要在隐私和实用性之间进行仔细的权衡。我们提出了真实且隐私保护的合成数据生成(RPSG)方法,通过使用私有种子并集成隐私保护策略(包括在候选选择中采用正式的差分隐私机制)来生成逼真的合成数据。针对最新方法进行的全面实验表明,RPSG在保持高保真度私有数据方面取得佳绩,同时提供了强大的隐私保护。

关键词

引用

@article{arxiv.2604.07486,
  title  = {Private Seeds, Public LLMs: Realistic and Privacy-Preserving Synthetic Data Generation},
  author = {Qian Ma and Sarah Rajtmajer},
  journal= {arXiv preprint arXiv:2604.07486},
  year   = {2026}
}

备注

22 pages, 7 figures, 18 tables