SoK:降低微调语言模型对成员推理攻击的脆弱性
机器学习
2024-03-14 v1 密码学与安全
摘要
近年来,自然语言处理模型经历了显著的增长,众多应用建立在其基础之上。其中许多应用需要在定制化的专有数据集上微调通用基础模型。这些微调数据尤其可能包含有关个人的隐私或敏感信息,从而导致隐私风险增加。成员推理攻击是评估机器学习模型隐私泄露最常用的攻击手段。然而,关于影响语言模型对此类攻击脆弱性的因素,或不同防御策略在语言领域的适用性,现有研究十分有限。我们首次系统性地回顾了微调大语言模型对成员推理攻击的脆弱性、涉及的各种因素以及不同防御策略的有效性。我们发现,某些训练方法能显著降低隐私风险,其中差分隐私与低秩适配器的组合实现了针对这些攻击的最佳隐私保护。
引用
@article{arxiv.2403.08481,
title = {SoK: Reducing the Vulnerability of Fine-tuned Language Models to Membership Inference Attacks},
author = {Guy Amit and Abigail Goldsteen and Ariel Farkash},
journal= {arXiv preprint arXiv:2403.08481},
year = {2024}
}
备注
preliminary version