用于隐私保护合成重写的强化学习微调大语言模型
密码学与安全
2025-08-28 v1 人工智能
机器学习
摘要
现代机器学习系统的性能依赖于对大型、高质量数据集的访问,这些数据集通常来源于用户生成的内容或专有的特定领域语料库。然而,这些丰富的数据集本质上包含敏感的个人信息,引发了对隐私、数据安全和遵守监管框架的重大担忧。虽然传统的匿名化技术可以移除显式标识符,但这种移除可能会导致下游机器学习任务的性能下降。更重要的是,简单的匿名化可能无法有效抵御利用隐式信号(如写作风格、主题焦点或人口统计线索)的推理攻击,突出了在模型训练期间需要更强大的隐私保护措施。为了解决平衡用户隐私和数据效用这一具有挑战性的问题,我们提出了一个强化学习框架,该框架使用复合奖励函数微调大语言模型(LLM),该函数联合优化显式和隐式隐私、语义保真度和输出多样性。为了有效捕捉群体层面的规律性,隐私奖励将语义线索与从潜在表示上的最小生成树(MST)导出的结构模式相结合。通过对这些隐私敏感信号在其分布上下文中进行建模,所提出的方法引导模型生成合成重写,在减轻隐私风险的同时保留效用。实证结果表明,所提出的方法显著增强了作者混淆和隐私指标,而不会降低语义质量,为大语言模型时代的隐私保护数据生成提供了一种可扩展且与模型无关的解决方案。
引用
@article{arxiv.2508.19286,
title = {RL-Finetuned LLMs for Privacy-Preserving Synthetic Rewriting},
author = {Zhan Shi and Yefeng Yuan and Yuhong Liu and Liang Cheng and Yi Fang},
journal= {arXiv preprint arXiv:2508.19286},
year = {2025}
}