通过调整影响函数追踪语言模型对训练数据的隐私泄露
机器学习
2024-09-06 v4 计算与语言
密码学与安全
摘要
大语言模型(LLMs)生成的回复可能包含来自个人和组织的敏感信息,导致潜在的隐私泄露。本工作实现了影响函数(IFs)以将隐私泄露追溯至训练数据,从而缓解语言模型的隐私问题。然而,我们注意到当前IFs难以准确估计具有大梯度范数的token的影响,可能高估其影响。在追溯最具影响力的样本时,这导致经常追溯回具有大梯度范数token的样本,掩盖了实际最具影响力的样本,即使它们的影响被很好地估计。为了解决这个问题,我们提出了启发式调整影响函数(HAIF),它降低了具有大梯度范数的token的权重,从而显著提高了追溯最具影响力样本的准确性。为了建立易于获取的隐私泄露追溯基准真值,我们构建了两个数据集PII-E和PII-CR,分别代表两种不同场景:一种是模型输出与预训练数据中的文本相同,另一种是模型利用其推理能力生成与预训练数据不同的文本。与各种GPT-2和QWen-1.5模型相比,HAIF显著提升了追溯准确性,在PII-E数据集上提升了20.96%至73.71%,在PII-CR数据集上提升了3.21%至45.93%。HAIF在真实世界预训练数据CLUECorpus2020上也优于最先进IFs,表现出对提示和回复长度的强鲁棒性。
引用
@article{arxiv.2408.10468,
title = {Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions},
author = {Jinxin Liu and Zao Yang},
journal= {arXiv preprint arXiv:2408.10468},
year = {2024}
}