中文

基于强化学习的 LLM 高效差分隐私微调

机器学习 2025-07-31 v1 人工智能 计算与语言

摘要

数据隐私与模型效用之间的张力已成为大型语言模型 (LLM) 在包含医疗等敏感语料库的训练部署的瓶颈。差分隐私随机梯度下降 (DP-SGD) 能保证形式隐私,但以显著的代价为此付出:梯度被强制裁剪并添加噪声,导致样本效率和最终准确率下降。已提出诸多变体以缓解这一权衡,但它们都有一个劣势:控制参数硬编码、全局且对优化景观的演变毫无察觉。因此,实践者要么为追求效用而过度消耗隐私预算,要么为了维持隐私约束而接受平庸的模型。我们提出了 RLDP,即首个将 DP 优化本身建模为可由现代深度强化学习 (RL) 所求解的闭环控制问题的框架。RLDP 持续感知学习动力学的丰富统计信息,并通过选择每参数梯度裁剪阈值以及注入高斯噪声的大小来作出决策。期间,训练一个软演员-评论家 (SAC) 超策略,该策略在语言模型微调期间在线学习,从零开始学习如何在何时何地分配隐私预算。在超过 1600 项消除实验中,RLDP 对 GPT2-small、Llama-1B、Llama-3B 和 Mistral-7B 实现了 1.3-30.5% 的困惑度降低(平均 5.4%),并实现了平均 5.6% 的下游效用提升。RLDP 在仅需 13-43% 的梯度更新预算(平均加速 71%)即可达到每个基准的最终效用,同时遵守相同的 (ϵ\epsilon, δ\delta)-DP 约束,并显示出与基准相当甚至更低的成员推断和 canary 提取攻击敏感性。

关键词

引用

@article{arxiv.2507.22565,
  title  = {Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning},
  author = {Afshin Khadangi and Amir Sartipi and Igor Tchappi and Ramin Bahmani and Gilbert Fridgen},
  journal= {arXiv preprint arXiv:2507.22565},
  year   = {2025}
}