BLIA:基于被动标签推断攻击的二分类模型记忆检测
机器学习
2025-03-18 v1 密码学与安全
摘要
模型记忆对机器学习模型的泛化能力以及其训练数据的隐私具有重要影响。本文通过两种新型被动标签推断攻击(BLIA)探讨了二分类模型中的标签记忆问题。这两种攻击是被动式的,仅依赖于预训练模型的输出,如置信度得分和对数损失值,无需与训练过程交互或修改。在受控子集中人为翻转 50% 的标签,称为"canaries",以评估在无标签差分隐私(Label-DP)和基于随机响应的 Label-DP 训练条件下标签记忆的程度。尽管应用了不同程度的 Label-DP,所提攻击仍始终实现超过 50% 的成功率,超出随机猜测的基线,充分证明即使这些标签与特征毫无关联,模型仍会记忆训练标签。
引用
@article{arxiv.2503.12801,
title = {BLIA: Detect model memorization in binary classification model through passive Label Inference attack},
author = {Mohammad Wahiduzzaman Khan and Sheng Chen and Ilya Mironov and Leizhen Zhang and Rabib Noor},
journal= {arXiv preprint arXiv:2503.12801},
year = {2025}
}