中文

面向白盒语言模型监督微调的主动隐私审计研究

计算与语言 2024-11-13 v2 人工智能

摘要

预训练与微调方法已成为各类 NLP 应用的主流技术。然而,近期研究表明,微调数据因其敏感性、领域特异性和可识别性,带来了显著的隐私担忧。为助力开发更具隐私韧性的微调模型,我们提出了一种新颖的主动隐私审计框架——Parsing,旨在识别并量化语言模型在监督微调(SFT)过程中的隐私泄露风险。该框架以改进的白盒成员推理攻击(MIA)为核心技术,利用新颖的学习目标和两阶段流水线监控语言模型的微调过程,最大化暴露隐私风险。此外,我们提升了 MIA 对包括 GPT-2、Llama2 及其部分变体在内的大型语言模型的有效性。本研究旨在为语言模型的 SFT 社区提供一个可靠、开箱即用的隐私审计工具,并为微调过程中的隐私保护提供有价值的见解。实验结果证实了该框架在多种模型和任务上的有效性,凸显了微调过程中的显著隐私担忧。项目代码可在 https://anonymous.4open.science/r/PARSING-4817/ 获取。

关键词

引用

@article{arxiv.2411.07070,
  title  = {On Active Privacy Auditing in Supervised Fine-tuning for White-Box Language Models},
  author = {Qian Sun and Hanpeng Wu and Xi Sheryl Zhang},
  journal= {arXiv preprint arXiv:2411.07070},
  year   = {2024}
}