估计语言模型中增强语境知识的隐私泄露
计算与语言
2025-12-17 v3 机器学习
摘要
语言模型 (LM) 依赖其参数化知识与相关语境知识相结合,以完成某些任务,如问答。然而,语境知识可能包含私人信息,在回答查询时可能被泄露,而估计这种隐私泄露尚不为人所了解。直接将 LM 的输出与语境进行比较的简单方法会高估隐私风险,因为 LM 的参数化知识可能已经包含了增强的语境知识。为此,我们引入*语境影响*这一指标,它基于微分隐私(一种广泛采用的隐私概念),用于估计解码期间语境知识的隐私泄露。我们的方法有效地测量每个语境子集对 LM 响应的影响,同时分离 LM 的特定参数化知识。使用我们的语境影响指标,我们演示了当语境知识相对于参数化知识不在同一分布时,才会发生语境隐私泄露。此外,我们实验性地展示了语境影响如何正确归因于增强语境的隐私泄露,并评估了诸多因素(如模型大小、语境大小、生成位置等)对语境隐私泄露的影响。我们的结果的实际意义将为实践者提供关于增强语境知识相关隐私风险的指导。
引用
@article{arxiv.2410.03026,
title = {Estimating Privacy Leakage of Augmented Contextual Knowledge in Language Models},
author = {James Flemings and Bo Jiang and Wanrong Zhang and Zafar Takhirov and Murali Annavaram},
journal= {arXiv preprint arXiv:2410.03026},
year = {2025}
}