语言模型中个人可识别信息泄露的分析
机器学习
2023-04-25 v4
摘要
已有研究表明,语言模型(LM)可通过句子级成员推断与重构攻击泄露训练数据的信息。理解LM泄露个人可识别信息(PII)的风险受到的关注较少,这可归因于一个错误的假设,即数据整理技术(如清洗)足以防止PII泄露。清洗技术降低了但并未消除PII泄露风险:在实践中清洗是不完善的,且必须在最小化披露与保持数据集效用之间权衡。另一方面,旨在保证句子级或用户级隐私的算法防御(如差分隐私)在多大程度上防止PII披露尚不清楚。在本工作中,我们针对通过黑盒提取、推断和重构攻击(仅通过API访问LM)导致的三类PII泄露引入了严格的基于博弈的定义。我们在三个领域(判例法、医疗保健和电子邮件)中对经防御与未经防御微调的GPT-2模型实证评估了这些攻击。我们的主要贡献为:(i) 可提取比现有攻击多至多10 PII序列的新颖攻击;(ii) 表明句子级差分隐私降低了PII披露风险但仍泄露约3%的PII序列;(iii) 记录级成员推断与PII重构之间的微妙联系。复现文中所有实验的代码见 https://github.com/microsoft/analysing_pii_leakage。
引用
@article{arxiv.2302.00539,
title = {Analyzing Leakage of Personally Identifiable Information in Language Models},
author = {Nils Lukas and Ahmed Salem and Robert Sim and Shruti Tople and Lukas Wutschitz and Santiago Zanella-Béguelin},
journal= {arXiv preprint arXiv:2302.00539},
year = {2023}
}
备注
IEEE Symposium on Security and Privacy (S&P) 2023