中文

Antibody:通过减弱有害梯度影响强化大语言模型的有害微调防御

机器学习 2026-03-03 v1 人工智能

摘要

微调即服务 (fine-tuning-as-a-service) 引入了当服务提供方针用户提交的数据集上进行微调时,对大语言模型安全构成威胁,这种过程称为有害微调攻击。本文我们展示,通过对在微调期间遇到的有害样本的梯度贡献进行正则化,可以有效缓解有害微调攻击的影响。为此,我们提出 Antibody 防御策略:首先确保微调前模型具备稳健的安全对齐,然后在微调期间应用安全保护学习算法。具体而言,在微调前的对齐阶段,我们提出通过优化模型使其对有害样本处于损失函数的平坦区域,从而增强后续有害微调的韧性。随后,在微调阶段,我们设计一种微调算法,对每个训练批次中的所有样本应用加权方案,以抑制模型学习有害样本的能力,同时鼓励学习良性样本。实验结果表明,Antibody 成功缓解了有害微调攻击,同时提升了在用户提交数据集上的微调性能。

关键词

引用

@article{arxiv.2603.00496,
  title  = {A Polynomial-Time Axiomatic Alternative to SHAP for Feature Attribution},
  author = {Kazuhiro Hiraki and Shinichi Ishihara and Takumi Kongo and Junnosuke Shino},
  journal= {arXiv preprint arXiv:2603.00496},
  year   = {2026}
}

备注

28 pages, 4 figures, 2 tables. Code will be released