PrivacyXray:通过语义一致性和概率确定性检测LLM中的隐私泄露
密码学与安全
2025-06-25 v1 人工智能
摘要
大型语言模型(Large Language Models, LLMs)在医疗、金融和法律等敏感领域广泛应用,引发了在推理期间潜在泄露私人信息的担忧。隐私提取攻击,如越狱攻击,通过精心设计输入来迫使模型输出敏感信息,从而暴露了LLMs的漏洞。然而,这些攻击无法验证提取的私人信息是否准确,因为不存在公共数据集进行交叉验证,导致在推理期间缺乏对私人信息检测的关键方法。为此,我们提出PrivacyXray,一种通过分析LLM内部状态来检测隐私泄露的新框架。我们的分析揭示,LLMs在生成正确的私人输出时表现出更高的语义一致性和概率确定性。基于此,PrivacyXray使用四项指标检测隐私泄露:跨层和 intra-layer 语义相似性、标记级和句子级概率分布。PrivacyXray通过克服缺乏开源私人数据集的挑战,消除对外部数据进行验证的依赖。它通过合成真实的私人数据和基于LLMs内部状态的检测机制实现此目标。实验表明,PrivacyXray在五个LLMs上实现了一致的性能,平均准确率达92.69%。与最先进的方法相比,PrivacyXray实现了显著的准确率提升,平均提升20.06%,凸显了其在实际应用中的稳定性和实用性。
引用
@article{arxiv.2506.19563,
title = {PrivacyXray: Detecting Privacy Breaches in LLMs through Semantic Consistency and Probability Certainty},
author = {Jinwen He and Yiyang Lu and Zijin Lin and Kai Chen and Yue Zhao},
journal= {arXiv preprint arXiv:2506.19563},
year = {2025}
}