中文

遗忘以繁荣:利用机器遗忘对预训练语言模型进行隐私泄露攻击

机器学习 2024-09-02 v1 人工智能 密码学与安全

摘要

在私有数据上对大型语言模型进行微调以用于下游应用,会带来显著的隐私风险,可能暴露敏感信息。目前,几个流行的社区平台提供了大量预训练模型的便捷分发,允许任何人发布模型而无需严格验证。这种场景造成了隐私威胁,因为预训练模型可能被恶意构造以危害微调数据集的隐私。在本研究中,我们引入了一种将模型遗忘作为攻击工具的新型投毒技术。该方法通过操纵预训练语言模型,在微调过程中增加私有数据的泄露。我们的方法在保持模型效用的同时,增强了成员推理攻击和数据提取攻击的效果。在不同模型、数据集和微调设置上的实验结果表明,我们的攻击显著超越了基线性能。这项工作对从未经证实的来源下载预训练模型的用户起到了警示作用,强调了其中潜在的隐私风险。

关键词

引用

@article{arxiv.2408.17354,
  title  = {Forget to Flourish: Leveraging Machine-Unlearning on Pretrained Language Models for Privacy Leakage},
  author = {Md Rafi Ur Rashid and Jing Liu and Toshiaki Koike-Akino and Shagufta Mehnaz and Ye Wang},
  journal= {arXiv preprint arXiv:2408.17354},
  year   = {2024}
}