中文

基于扩散模型的私有合成文本生成

计算与语言 2024-10-31 v1

摘要

扩散模型在生成合成文本方面的能力如何?近期研究表明其优势,性能已达到自回归LLM的水平。但它们在训练受到差分隐私保护的情况下是否也擅长生成合成数据?对此问题的证据尚缺失,尽管私有图像生成的前景看起来很有希望。在本文中,我们通过大量实验探讨了这一开放问题。同时,我们批判性地评估(并重新实现)了先前关于使用LLM进行私有合成文本生成的工作,揭示了一些可能导致差分隐私保证被违反的未满足假设。我们的结果部分与先前的非私有研究结论相矛盾,并表明完全开源LLM在隐私设定下优于扩散模型。我们的完整源代码、数据集和实验设置公开可用,以促进未来研究。

关键词

引用

@article{arxiv.2410.22971,
  title  = {Private Synthetic Text Generation with Diffusion Models},
  author = {Sebastian Ochs and Ivan Habernal},
  journal= {arXiv preprint arXiv:2410.22971},
  year   = {2024}
}