中文

尾部为全部所指:无需参考模型即可估计模型级成员推断漏洞

机器学习 2025-10-23 v1 密码学与安全

摘要

成员推断攻击(MIAs)已成为评估 AI 模型隐私风险的标准工具。然而,最先进的攻击需要大量训练,往往计算成本高昂的参考模型,限制了其实际应用性。我们提出了一种无需参考模型的方法,用于估计模型级漏洞,即在低假正率下的真正率(TPR)。经验分析表明,损失分布呈非对称和厚尾分布,提示大多数来自 MIAs 的高风险点已从分布的尾部(高损失区域)移动到头部(低损失区域)。我们利用这一洞见,提出了一种仅从训练和测试分布估计模型级漏洞的方法:利用缺乏来自高损失区域的异常值作为风险预测器。我们评估了该方法——简单损失攻击的真负率比(TNR)——在广泛的架构和数据集上的表现,并证明其能够准确估计针对最先进成员推断攻击(LiRA)的模型级漏洞。我们还展示了该方法优于一些低成本(如 RMIA)攻击以及分布差异的其他度量方式。最终,我们评估了使用非线性函数来评估风险的用途,表明该方法在评估大型语言模型风险方面具有前景。

关键词

引用

@article{arxiv.2510.19773,
  title  = {The Tail Tells All: Estimating Model-Level Membership Inference Vulnerability Without Reference Models},
  author = {Euodia Dodd and Nataša Krčo and Igor Shilov and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2510.19773},
  year   = {2025}
}