中文

使用大语言模型生成多样化写作风格的隐私保护合成评论

计算与语言 2025-07-25 v1 密码学与安全 机器学习

摘要

大型语言模型(Large Language Models, LLMs)生成的合成数据正在为数据驱动应用带来机遇与挑战。尽管合成数据以成本效益高、可扩展的方式作为真实数据,来促进模型训练,但其多样性和隐私风险仍未得到充分探讨。本文聚焦于基于文本的合成数据,提出了一套全面的指标,用于量化评估由多种最先进LLMs生成的合成数据集的多样性(即语言表达、情感和用户视角)和隐私(即重识别风险和风格离群值)。实验结果表明,LLMs在生成多样性和隐私保护的合成数据方面存在显著局限。针对评估结果,我们提出了一种基于提示词的方法,以在保持评论人隐私的同时提升合成评论的多样性。

关键词

引用

@article{arxiv.2507.18055,
  title  = {Privacy-Preserving Synthetic Review Generation with Diverse Writing Styles Using LLMs},
  author = {Tevin Atwal and Chan Nam Tieu and Yefeng Yuan and Zhan Shi and Yuhong Liu and Liang Cheng},
  journal= {arXiv preprint arXiv:2507.18055},
  year   = {2025}
}