中文

Neighborhood Blending:一种轻量级推理时间防御机制,用于抵御成员推断攻击

密码学与安全 2026-02-16 v1

摘要

近年来,作为服务的机器学习(MLaaS)的广泛采用,尤其在敏感环境中,引发了重大的隐私关注。其中尤为重要的是成员推断攻击(MIAs),它们利用训练数据和非训练数据之间的行为差异来确定特定记录是否包含在模型的训练集中,从而构成显著的隐私风险。尽管已有防御措施,如对抗正则化、DP-SGD和MemGuard,有助于缓解这些威胁,但往往伴随实用性权衡、增加计算需求或对多样化攻击向量的保护不一致。本文引入一种新的推理时间防御机制,称为Neighborhood Blending,通过平滑查询样本邻域的模型置信度输出来缓解MIAs,而无需重新训练模型或产生显著的计算开销。我们的 method 通过对基于差分隐私抽样选取的相似训练样本进行平均来建立一致的置信度模式,从而使成员和非成员对抗者而言难以区分,同时保持高实用性。显著地,Neighborhood Blending 保持标签完整性(零标签损失),通过自适应的“按需支付”扭曲策略确保高实用性。它是一种模型无关的方法,提供一种实用的轻量级解决方案,在不牺牲模型实用性的前提下增强隐私。通过在多样化数据集和模型上进行大量实验,我们展示了该防御显著降低了MIA成功率,同时保持模型性能,在实用性保留方面优于现有的后处理防御措施如MemGuard和训练时间技术如DP-SGD。

关键词

引用

@article{arxiv.2602.12943,
  title  = {Neighborhood Blending: A Lightweight Inference-Time Defense Against Membership Inference Attacks},
  author = {Osama Zafar and Shaojie Zhan and Tianxi Ji and Erman Ayday},
  journal= {arXiv preprint arXiv:2602.12943},
  year   = {2026}
}