中文

面向未见类别的成员推断攻击

机器学习 2025-10-28 v2 密码学与安全 机器学习

摘要

基于阴影模型的成员推断攻击是目前针对机器学习模型的最佳方法,这些模型在保存的非成员数据子集上模仿目标模型的行为。然而,我们发现,这类攻击因一个关键假设而根本受限——阴影模型能够复制感兴趣分布上目标模型的行为。结果表明,依赖阴影模型的攻击在数据访问受到法律、伦理或日志istical 限制的关键AI安全应用中会失败,因为阴影模型对查询示例毫无合理信号。虽然这个问题似乎在阴影模型范式下难以解决,但我们发现分位数回归攻击在该情境下是有前景的,因为这些模型学习的成员示例特征可以泛化到未见类别。我们通过实证和理论方法都证明了,分位数回归攻击在实际操作中实现了阴影模型方法的最高可达11倍的真阳性率,并提供了一项理论模型,概述了该方法成功所需的泛化属性。我们的工作识别了现有MIA的一个重要失效模式,为旨在直接使用现有工具进行AI安全实际应用的实践者提供了警示。

关键词

引用

@article{arxiv.2506.06488,
  title  = {Membership Inference Attacks for Unseen Classes},
  author = {Pratiksha Thaker and Neil Kale and Zhiwei Steven Wu and Virginia Smith},
  journal= {arXiv preprint arXiv:2506.06488},
  year   = {2025}
}

备注

Preprint