带有虚假隐私的生成数据:微调大语言模型于生成数据的隐藏危险
密码学与安全
2025-01-30 v2 机器学习
摘要
大型语言模型(LLMs)在各种特定领域任务中取得了显著成功,其性能在微调后通常会有大幅提升。然而,使用真实世界数据进行微调会带来隐私风险。为了减轻这些风险,开发者越来越多地依赖合成数据生成作为真实数据的替代方案,因为传统模型生成的数据被认为与真实世界数据不同。然而,随着 LLM 能力的增强,真实数据与这些模型生成的数据之间的区别已变得几乎难以分辨。这种趋同给生成数据带来了与真实数据相关的类似隐私风险。我们的研究通过考察 LLM 生成数据的结构特征,重点关注两种主要的微调方法:使用非结构化(纯文本)生成数据的监督微调(SFT)和自指导微调,来调查使用 LLM 生成的数据进行微调是否真正增强了隐私,还是引入了额外的隐私风险。在 SFT 场景中,数据被放入先前研究使用的特定指令调整格式。我们使用个人身份信息(PII)泄露和成员推断攻击(MIAs)对 Pythia 模型套件和 OPT 进行隐私风险评估。值得注意的是,在使用非结构化生成数据进行微调后,Pythia 的 PII 提取成功率增加了超过 20%,凸显了此类方法的潜在隐私影响。此外,对于该套件中第二大模型 Pythia-6.9b,在自指导微调后,其 MIA 的 ROC-AUC 分数增加了超过 40%。我们的结果表明,使用生成数据微调 LLM 存在潜在的隐私风险,强调了在此类方法中考虑隐私保护措施的必要性。
引用
@article{arxiv.2409.11423,
title = {Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data},
author = {Atilla Akkus and Masoud Poorghaffar Aghdam and Mingjie Li and Junjie Chu and Michael Backes and Yang Zhang and Sinem Sav},
journal= {arXiv preprint arXiv:2409.11423},
year = {2025}
}
备注
Accepted at 34th USENIX Security Symposium, 2025