中文

Antibody:通过减弱有害梯度影响强化大语言模型对有害微调的防御

机器学习 2026-03-03 v1

摘要

即服务的微调引入了对大语言模型安全的威胁,当服务提供方针在用户提交的数据集上进行带毒微调时,即为有害微调攻击。本文表明,通过对在微调期间遇到的有害样本的梯度贡献进行正则化,可有效缓解有害微调攻击的影响。为此,我们提出 Antibody 防御策略:首先在微调前确保模型对有害样本具有稳健的安全对齐,然后在微调期间应用安全保护学习算法。具体而言,在微调前的对齐阶段,我们提出优化模型使其对有害样本处于损失函数的平坦区域,从而使安全对齐更抗后续有害微调。随后,在微调阶段,我们设计一种对每个训练小批量中的所有样本施加加权方案的微调算法,以抑制模型学习有害样本的能力,同时鼓励学习良性样本。实验结果表明,Antibody 成功缓解了有害微调攻击,同时提升了在用户提交数据集上的微调性能。

关键词

引用

@article{arxiv.2603.00498,
  title  = {Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence},
  author = {Quoc Minh Nguyen and Trung Le and Jing Wu and Anh Tuan Bui and Mehrtash Harandi},
  journal= {arXiv preprint arXiv:2603.00498},
  year   = {2026}
}

备注

Published at ICLR 2026