关于 LLM 隐私的消融研究
密码学与安全
2026-05-05 v1 人工智能
摘要
大型语言模型 (LLM) 在交互式和检索增强场景中日益广泛部署,引发了显著的隐私担忧。虽然已研究了成员推断 (MIA)、属性推断 (AIA)、数据提取 (DEA) 和后门攻击 (BA) 等攻击方式,但这些攻击通常在孤立环境中进行分析,缺乏对常见系统因素下行为的综合理解。本文引入统一威胁模型和符号体系,复现代表性的隐私攻击方法,并进行结构化消融研究,评估模型架构、规模、数据集特征以及检索配置等关键因素的影响。我们的分析显示,不同攻击类型表现出明显差异。成员推断攻击,尤其是基于掩码的变体,表现出强大且可靠的信号;而后门攻击由于其触发器驱动的特性,实现了持续的高成功率。相比之下,属性推断和数据提取攻击更具挑战性,准确率较低,但仍然风险巨大,因为它们针对的是敏感个人信息。总体而言,这些结果表明,LLM 系统的隐私风险高度依赖具体情境,由设计选择驱动,强调需要整体评估和明智的部署实践。
引用
@article{arxiv.2605.02255,
title = {On the Privacy of LLMs: An Ablation Study},
author = {Karima Makhlouf and Lamiaa Basyoni and Syed Khaderi and Gabriel Marquez and Peter Sotomango and Mahmoud Awawdah and Sami Zhioua},
journal= {arXiv preprint arXiv:2605.02255},
year = {2026}
}