在现实假设下重新审视 LiRA 成员推断攻击
摘要
成员推断攻击 (Membership inference attacks, MIAs) 已成为评估机器学习 (ML) 中隐私泄露的标准工具。在此类攻击中, Likelihood-Ratio Attack (LiRA) 被认为是在足够多个影子模型可用时达到最佳效果的方法。然而, 先前的评估常常因攻击模型对训练样本过度自信、在目标数据上校准阈值、假设成员先验平衡以及忽视攻击可重复性等问题而高估了 LiRA 的有效性。我们在符合现实协议的框架下重新评估 LiRA: (i) 使用抗过拟合 (Anti-Overfitting, AOF) 和迁移学习 (Transfer Learning, TL), 在适用时以减少生产模型中的过度自信为目标训练模型; (ii) 使用影子模型和数据而非目标数据校准决策阈值; (iii) 在影子基准阈值下衡量正预测值 (PPV, 或精确度) 并考虑偏斜的成员先验 (pi <= 10%); (iv) 量化不同随机种子和训练变体下的 per-sample 成员可重复性。我们发现, AOF 显著削弱了 LiRA, 而 TL 进一步降低攻击效果的同时提升模型精度。在影子基准阈值和偏斜先验下, LiRA 的 PPV 往往大幅下降, 尤其是在采用 AOF 或 AOF+TL 时。我们还发现, 在极低假正率下阈值化的易受攻击集合在不同运行之间表现出差异较大, 而似比值排名更稳定。这些结果表明, 在现实条件下, LiRA 乃至更弱的 MIAs 的有效性往往低于之前所暗示的, 可靠的隐私审计需要反映实际训练实践、可行的攻击假设以及可重复性考量的评估协议。代码已公开于 https://github.com/najeebjebreel/lira_analysis。
引用
@article{arxiv.2603.07567,
title = {Revisiting the LiRA Membership Inference Attack Under Realistic Assumptions},
author = {Najeeb Jebreel and Mona Khalil and David Sánchez and Josep Domingo-Ferrer},
journal= {arXiv preprint arXiv:2603.07567},
year = {2026}
}
备注
Accepted to PoPETs 2026(3)