PACZero:通过符号量化实现语言模型的 PAC 隐私微调
机器学习
2026-05-26 v2 人工智能
密码学与安全
摘要
我们引入了 PACZero,一族用于微调大语言模型且在 时提供可用效用的 PAC 隐私零阶机制。该隐私机制将成员推理攻击(MIA)后验成功率限制在先验水平,这是一种 DP 框架仅在 且有无穷噪声时才能达到的 MIA 抗性水平。下文所有 DP-ZO 比较均在 MIA 后验水平上进行了匹配。关键洞察在于,PAC Privacy 仅在发布依赖于哪个候选子集是秘密时才收取互信息。对子集聚合的零阶梯度进行符号量化会产生频繁的一致性,即每个候选子集在更新方向上达成一致的步骤;在这些步骤中,发布的符号产生零条件互信息。我们提出了跨越隐私-效用权衡的两种变体:PACZero-MI(通过在二值发布上进行精确校准来预算 MI)和 PACZero-ZPL(通过在不一致步骤上进行均匀硬币翻转实现 )。我们在 SST-2 和 SQuAD 上使用 OPT-1.3B 和 OPT-6.7B 在 LoRA 和全参数两条路线上进行了评估。在 SST-2 上使用 OPT-1.3B 进行 的全微调时,PACZero-ZPL 达到了 ,与非隐私的 MeZO 基线( FT)相差不到 pp。此前没有任何方法在高隐私机制 下产生可用效用,而 PACZero-ZPL 在 时在 OPT-1.3B 和 OPT-6.7B 上获得了具竞争力的 SST-2 准确率和非平凡的 SQuAD F1。
引用
@article{arxiv.2605.06505,
title = {PACZero: PAC-Private Fine-Tuning of Language Models via Sign Quantization},
author = {Murat Bilgehan Ertan and Xiaochen Zhu and Phuong Ha Nguyen and Marten van Dijk and Srinivas Devadas},
journal= {arXiv preprint arXiv:2605.06505},
year = {2026}
}