面向安全分类器的边界目标型成员推断攻击
机器学习
2026-05-25 v2 计算与语言
摘要
安全分类器是生成式 AI 系统中的关键安全措施,用于过滤有害内容或识别可能需要情感支持的用户。尽管这些模型必不可少,但它们是在包含自伤和心理健康讨论的敏感数据集上训练的,这引发了尚未充分理解的隐私问题。成员推断攻击(Membership Inference Attacks, MIAs)允许对抗者推断用于训练模型的示例成员身份。本文我们假设,识别模型置信度最低的示例对于对抗者推断成员身份非常有信息价值。这反映了泛化性的局部失效,即模型依赖于记忆来解决训练集中的歧义。为此,我们引入一种新的面向边界的选择策略,以放大示例在训练集中成员身份的信号。我们的实验结果表明,在针对检测可能需要情感支持的用户进行微调的分类器上,攻击者以 5% 的误报率可恢复 19% 被标记为用户情绪困扰的对话,这比仅使用最先进 MIA 方法的攻击高出 倍。最后,我们描述了边界示例并表明基于内容的过滤对保护效果不佳,而现有的噪声策略可有效缓解这些示例的易受攻击性。
引用
@article{arxiv.2605.22373,
title = {Boundary-targeted Membership Inference Attacks on Safety Classifiers},
author = {Anthony Hughes and Alexander Goldberg and Prince Jha and Adam Perer and Nikolaos Aletras and Niloofar Mireshghallah},
journal= {arXiv preprint arXiv:2605.22373},
year = {2026}
}