基于邻域比较的成员推断攻击对语言模型的威胁
计算与语言
2023-08-08 v2 密码学与安全
机器学习
摘要
成员推断攻击(MIAs)旨在预测某个数据样本是否存在于机器学习模型的训练数据中,被广泛用于评估语言模型的隐私风险。大多数现有攻击依赖于如下观察:模型往往对其训练样本赋予比非训练点更高的概率。然而,孤立地对模型得分进行简单阈值化往往导致高误报率,因其未考虑样本的内在复杂度。近期工作表明,基于参考的攻击将模型得分与在相似数据上训练的参考模型所得得分进行比较,可显著提升 MIA 性能。但是,为训练参考模型,此类攻击作出了一个强且可谓不现实的假设:攻击者能访问与原始训练数据高度相似的样本。因此,我们在更现实的场景下考察其性能,发现它们相对于用于训练参考模型的数据分布极为脆弱。为探究此脆弱性是否提供了一层安全性,我们提出并评估了邻域攻击,其将给定样本的模型得分与合成生成的邻域文本得分进行比较,从而消除对训练数据分布的访问需求。我们表明,除与对训练数据分布具有完美知识的基于参考的攻击相当外,我们的攻击明显优于现有的无参考攻击以及具有不完美知识的基于参考的攻击,这证明了有必要重新评估对抗性攻击的威胁模型。
引用
@article{arxiv.2305.18462,
title = {Membership Inference Attacks against Language Models via Neighbourhood Comparison},
author = {Justus Mattern and Fatemehsadat Mireshghallah and Zhijing Jin and Bernhard Schölkopf and Mrinmaya Sachan and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:2305.18462},
year = {2023}
}