中文

面向中间表示的分层成员推断缓解:采用差分隐私训练

机器学习 2026-05-12 v2

摘要

在嵌入即接口 (EaaI) 场景中,预训练模型用于查询中间表示 (IR)。IR 的分布特性会泄露训练集成员信号,启用成员推断攻击 (MIA),其强度在不同层次上存在差异。尽管差分隐私随机梯度下降 (DP-SGD) 能缓解此类泄露,但现有实现采用逐例梯度裁剪和统一、层无关的噪声乘数,忽略了各层 MIA 脆弱性的异质性。本文引入基于层次 MIA 风险的 DP-SGD (LM-DP-SGD),在比例其 MIA 风险的基础上对各层进行自适应隐私保护分配。具体而言,LM-DP-SGD 在公开影子数据集上训练影子模型,从其训练/测试分割中提取逐层 IR,并拟合层特定 MIA 对手,利用其攻击错误率作为 MIA 风险估计。基于跨数据集 MIAs 的可迁移性,这些估计随后用于重新加权全局裁剪梯度中各层的贡献,从而在固定噪声幅度下提供层次化的隐私保护。我们进一步在 LM-DP-SGD 的隐私和收敛性方面建立了理论保证。大量实验表明,在相同隐私预算下,LM-DP-SGD 在保持实用性的同时,将峰值 IR 级 MIA 风险降低到了更低水平,实现了更优的隐私-效用权衡。

关键词

引用

@article{arxiv.2602.22611,
  title  = {Mitigating Membership Inference in Intermediate Representations with Differentially Private Training},
  author = {Jiayang Meng and Tao Huang and Chen Hou and Guolong Zheng and Hong Chen},
  journal= {arXiv preprint arXiv:2602.22611},
  year   = {2026}
}