中文

通过令牌遮蔽缓解语言模型中的梯度反转风险

计算与语言 2026-02-19 v1

摘要

大规模语言模型的训练和微调主要受益于协作式学习,但该方法已被证明对梯度反转攻击(Gradient Inversion Attacks, GIAs)脆弱,攻击者可从共享的梯度中重建私有训练数据。现有防御措施主要采用梯度扰动技术,如噪声注入或梯度修剪,以破坏GIAs从梯度空间到标记空间的直接映射。然而,这些方法往往力不足,因为梯度、嵌入和标记空间间仍保留语义相似性。在本工作中,我们提出一种新型防御机制,名为GHOST(gradient shield with obfuscated tokens),即一种基于令牌遮蔽的机制,通过解耦梯度、嵌入和标记空间之间的内在联系来中和GIAs。GHOST建立在一个重要洞察之上:由于标记空间的规模,存在语义上distinct但嵌入接近的标记,可作为原始标记的影子替代品,这实现了在标记空间中保持语义断开,同时在嵌入和梯度空间中保留连接。GHOST包括一个搜索步骤,用于多标准搜索识别语义distinct的候选标记,以及一个选择步骤,用于选择最佳影子标记,以确保通过保留与原始标记产生的内部输出的对齐,最小化对训练中关键特征的干扰。针对从BERT到Llama的各种模型架构和数据集进行评估,显示出GHOST在保护隐私(恢复率低至1%)和保持实用性(分类F1最高达0.92,困惑度最高达5.45)方面在分类和生成任务中对抗最先进的GIAs和自适应攻击场景表现出色。

关键词

引用

@article{arxiv.2602.15897,
  title  = {Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation},
  author = {Xinguo Feng and Zhongkui Ma and Zihan Wang and Alsharif Abuadbba and Guangdong Bai},
  journal= {arXiv preprint arXiv:2602.15897},
  year   = {2026}
}