LLM 自适应标记加权差分隐私:并非所有标记都需要相同保护
机器学习
2025-09-30 v1 人工智能
摘要
大语言模型(LLM)经常记忆敏感或个人信息,引发显著隐私顾虑。现有的差分隐私随机梯度下降(DP-SGD)变体对每个梯度步骤注入均匀噪声,显著延长训练时间并降低模型准确率。我们提出,将噪声主要注入与敏感标记相关的梯度,可显著减少 DP 训练时间,加强对敏感信息的保护,同时保持模型在非敏感数据上的性能。我们通过自适应标记加权差分隐私(ATDP)实现了这一思想,这是一种对 vanilla DP-SGD 的修改,能够为敏感和非敏感标记自适应分配不同的梯度权重。通过在训练初期采用更大的噪声尺度,ATDP 能快速干扰对敏感内容的记忆。因此,ATDP 只需少量额外的轻量级后处理即可完成标准微调,主要在对应敏感标记的参数上注入针对性噪声,从而最小化影响模型通用能力。ATDP 可无缝集成到任何现有的 DP 微调管道中,或直接应用于非私有模型作为快速的隐私增强措施。此外,结合初始的已删除微调阶段,ATDP 形成了一条简洁的 DP 管道,实现了相当于最先进 DP-SGD 方法的相当水平的 canary 保护,显著降低了 DP 微调的计算开销,将训练时间缩短约 90%,同时实现相当或更好的隐私保护,并在最小准确率退化方面表现良好。
引用
@article{arxiv.2509.23246,
title = {Adaptive Token-Weighted Differential Privacy for LLMs: Not All Tokens Require Equal Protection},
author = {Manjiang Yu and Priyanka Singh and Xue Li and Yang Cao},
journal= {arXiv preprint arXiv:2509.23246},
year = {2025}
}
备注
18 pages