基于训练动力学的情境探测式成员推断:面向微调大语言模型的隐私风险评估
密码学与安全
2025-12-23 v2 机器学习
摘要
成员推断攻击(MIAs)构成微调后大语言模型(LLMs)面临的关键隐私威胁,尤其是在使用敏感数据针对特定任务进行模型适配时。虽然已有黑箱MIAs技术依赖置信度得分或标记概率,但这些信号常与样本内在属性(如内容难度或稀有性)紧密耦合,导致泛化能力差且信噪比低。本文提出ICP-MIA,一种基于训练动力学理论的新型MIAs框架,特别关注优化过程中递减报酬的现象。我们引入“优化间隙”作为成员推断的基本信号:在收敛时,成员样本表现出最小的剩余损失减少潜力,而非成员样本则保留出显著的进一步优化潜力。为在黑箱环境中估计此间隙,我们提出情境探测(ICP)方法,通过构建战略性的输入上下文来模拟微调式行为。我们提出两种探针策略:基于参考数据(使用语义相似的公开样本)和自扰动(通过遮盖或生成)。在三个任务和多种大语言模型上的实验表明,ICP-MIA在各类黑箱MIAs技术中均显著优于先前方法,尤其在假阳性率较低时效果更为突出。我们进一步分析了参考数据对齐、模型类型、PEFT配置以及训练计划对攻击效果的影响。我们的发现表明,ICP-MIA是一个在部署型LLMs中进行隐私风险审计的实用且理论依据严谆的框架。
引用
@article{arxiv.2512.16292,
title = {In-Context Probing for Membership Inference in Fine-Tuned Language Models},
author = {Zhexi Lu and Hongliang Chi and Nathalie Baracaldo and Swanand Ravindra Kadhe and Yuseok Jeon and Lei Yu},
journal= {arXiv preprint arXiv:2512.16292},
year = {2025}
}