面向对抗组成的PAC私有响应
机器学习
2026-01-21 v1 密码学与安全
摘要
现代机器学习模型日益部署在API后面。这使得标准的权重隐私方法(如DP-SGD)在实用性方面代价过高。虽然模型权重在不同训练数据集间差异很大,但针对特定输入的模型响应却是低维且更稳定。这就激发了直接在模型输出上强制隐私保证的动机。我们在PAC隐私下进行研究,该方法通过控制互信息(MI)为任意黑盒函数提供实例级隐私保证。重要的是,PAC隐私会因输出稳定性而奖励更低的噪声水平。然而,一个核心挑战是:响应隐私需要组合大量由不可信用户自适应选择的、可能具有对抗性的查询,而现有的PAC隐私组合结果在此方面尚不充分。我们引入一种新算法,通过自适应噪声校准实现对抗性组合,并证明互信息保证在自适应和对抗性查询下是线性累积的。实验在表格、视觉和NLP任务上均表明,我们的方法在极小的每查询隐私预算下仍能实现高效能。在CIFAR-10上,我们以每步MI预算为的准确率达到87.79%。这使我们能够在可控成员推断攻击(MIA)成功率至51.08%的保证下服务一百万查询——该保证等同于-DP。此外,我们展示私有响应可用于为公共数据生成标签,以提炼出可发布的隐私保留模型;使用ImageNet子集作为公共数据集,我们的模型经21万次响应蒸馏获得91.86%的CIFAR-10准确率,MIA成功率上限为50.49%,相当于-DP。
引用
@article{arxiv.2601.14033,
title = {PAC-Private Responses with Adversarial Composition},
author = {Xiaochen Zhu and Mayuri Sridhar and Srinivas Devadas},
journal= {arXiv preprint arXiv:2601.14033},
year = {2026}
}
备注
16 pages, 3 figures