DP-SelFT:面向大型语言模型的差分隐私选择性微调
机器学习
2026-05-19 v1 密码学与安全
摘要
大型语言模型(LLM)通常通过微调适应下游任务,但微调数据常包含可能被导出模型泄露的敏感信息。差分隐私(DP)提供对此类泄露的正式保护,但 DP 微调 LLM 仍因梯度裁剪和噪声注入而出现显著的实用性下降。现有工作通过结合 DP 与参数高效微调方法(如 LoRA)来改善这一权衡,这类方法约束了更新的形式。本文研究了另一方向:选择性微调,通过约束更新的应用位置来提升效果。我们提出了 DP-SelFT,一种大型语言模型的差分隐私选择性微调框架。DP-SelFT 解决了参数选择中的三个 DP 特定挑战:避免重复隐私成本、在噪声估计下提高稳定性、选择在被裁剪和噪声更新下仍然有用的参数。它首先构建一个轻量级 DP 合成数据集,并仅对该合成数据执行选择,以避免额外的隐私成本。随后通过在合成训练分割上暂时训练候选子集,在合成验证分割上评估来实现层级选择。关键在于,这种暂时训练是在与下游 DP 微调相匹配的扰动 regime 下进行的,其最坏情况扰动规模与 DP 噪声相同。这有利于挑选那些不仅可学习,而且对噪声私有更新也稳健的层子集。在基准任务上的实验表明,DP-SelFT 在相同隐私保证下, consistently 优于现有 DP 微调基线。
引用
@article{arxiv.2605.17432,
title = {DP-SelFT: Differentially Private Selective Fine-Tuning for Large Language Models},
author = {Haichao Sha and Zihao Wang and Yuncheng Wu and Hong Chen and Wei Dong},
journal= {arXiv preprint arXiv:2605.17432},
year = {2026}
}