PerProb:间接评估大型语言模型记忆的框架
密码学与安全
2025-12-17 v1
摘要
大型语言模型 (LLM) 的快速发展得益于大规模数据集,其中可能包含敏感信息,引发严重的隐私问题。一个突出的威胁是会员推断攻击 (MIA),即对特定样本是否用于模型训练进行推断。然而,由于发现不一致且缺乏标准化评估方法,以及许多 LLM 训练集未披露,MIA 对 LLM 的真实影响尚不清楚。为此,我们提出了 PerProb,一个统一、无标签的框架,用于间接评估 LLM 记忆漏洞。PerProb 通过评估受害者模型与对手模型生成数据的困惑度和平均对数概率之间的变化,实现对训练引起记忆的间接估计。与依赖成员/非成员标签或内部访问的先前 MIA 方法相比,PerProb 独立于模型和任务,可用于黑盒和白盒设置。通过将 MIA 系统分类为四种攻击模式,我们在五个数据集上评估了 PerProb 的效果,揭示了 LLM 之间存在不同的记忆行为和隐私风险。此外,我们评估了包括知识蒸馏、提前停止和差分隐私在内的缓解策略,证明了其在减少数据泄露方面的有效性。我们的发现提供了一个实用且可推广的框架,用于评估和改进 LLM 隐私。
引用
@article{arxiv.2512.14600,
title = {PerProb: Indirectly Evaluating Memorization in Large Language Models},
author = {Yihan Liao and Jacky Keung and Xiaoxue Ma and Jingyu Zhang and Yicheng Sun},
journal= {arXiv preprint arXiv:2512.14600},
year = {2025}
}
备注
Accepted at APSEC 2025