PreCurious: 无 innocuous 预训练语言模型如何变为隐私陷阱
密码学与安全
2024-09-17 v3
摘要
预训练和微调范式已显示其有效性,已成为为各种任务定制语言模型的标准方法。当前,社区平台提供对各种预训练模型的便捷访问,任何人都可在缺乏严格验证过程的情况下发布模型。然而,精心设计的预训练模型可能成为微调数据集的隐私陷阱。本文提出 PreCurious 框架,揭示了新的攻击面:攻击者发布预训练模型并获取对最终微调模型的黑盒访问权限。PreCurious 旨在升级微调数据集的一般隐私风险,包括成员推断和数据提取。PreCurious 的关键直觉是操纵预训练模型的记忆阶段,并以看似合法的配置引导微调。尽管经验和理论证据表明,参数高效和差分隐私微调技术可防御针对微调模型的隐私攻击,但 PreCurious 在看似无害的预训练模型上演示了以狡诈方式突破此防御的可能性。尽管 DP 对成员推断攻击提供了一些缓解,但通过进一步利用已消毒数据集,PreCurious 显示了即使在严格隐私预算下(例如 )的差分隐私调优下,针对特定数据提取仍存在潜在漏洞。因此,PreCurious 对依赖于未知来源的预训练模型、仅依赖教程或常识防御,以及即使在完美消毒后仍发布消毒数据集的用户提出警告。
引用
@article{arxiv.2403.09562,
title = {PreCurious: How Innocent Pre-Trained Language Models Turn into Privacy Traps},
author = {Ruixuan Liu and Tianhao Wang and Yang Cao and Li Xiong},
journal= {arXiv preprint arXiv:2403.09562},
year = {2024}
}
备注
15 pages