中文

基于人工智能方法的记录级别隐私风险评估

机器学习 2025-06-13 v3 密码学与安全

摘要

成员推断攻击( MIA)广泛用于经验性评估机器学习模型的隐私风险,既提供模型级漏洞指标,又识别最易受攻击的训练样本。但最先进的方法需要训练与目标模型相同架构的大量影子模型。这使得评估大型模型隐私的计算成本对许多实际应用而言不可接受,尤其是在作为模型开发过程的一部分和用于大型模型时。我们提出了一种新方法,通过分析训练过程中天然可得的工件来识别最易受成员推断攻击的训练样本。我们的方法称为损失�迹四分位范围( LT-IQR),分析训练期间收集的逐样本损失轨迹,以无需额外模型训练的方式识别高风险样本。通过标准基准实验,我们展示LT-IQR在以92%精度(k=1%)识别最易受攻击的样本方面达到了业界最佳水平。这一结果在数据集和模型架构之间保持一致,LT-IQR在两种传统漏洞度量(如损失)和使用少量影子模型的轻量级MIA方法方面均表现优异。我们还表明LT-IQR能准确识别对多种MIA方法都具有风险的样本,并进行了消除实验。我们认为LT-IQR使模型开发者能在模型开发过程中免费识别易受攻击的训练样本。我们的结果强调了基于工件的方法在高效评估隐私风险方面的潜力。

关键词

引用

@article{arxiv.2411.05743,
  title  = {Free Record-Level Privacy Risk Evaluation Through Artifact-Based Methods},
  author = {Joseph Pollock and Igor Shilov and Euodia Dodd and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2411.05743},
  year   = {2025}
}