Antibody:通过减弱有害梯度影响强化大语言模型的有害微调防御
机器学习
2026-03-03 v1 人工智能
摘要
微调即服务 (fine-tuning-as-a-service) 引入了当服务提供方针用户提交的数据集上进行微调时,对大语言模型安全构成威胁,这种过程称为有害微调攻击。本文我们展示,通过对在微调期间遇到的有害样本的梯度贡献进行正则化,可以有效缓解有害微调攻击的影响。为此,我们提出 Antibody 防御策略:首先确保微调前模型具备稳健的安全对齐,然后在微调期间应用安全保护学习算法。具体而言,在微调前的对齐阶段,我们提出通过优化模型使其对有害样本处于损失函数的平坦区域,从而增强后续有害微调的韧性。随后,在微调阶段,我们设计一种微调算法,对每个训练批次中的所有样本应用加权方案,以抑制模型学习有害样本的能力,同时鼓励学习良性样本。实验结果表明,Antibody 成功缓解了有害微调攻击,同时提升了在用户提交数据集上的微调性能。
引用
@article{arxiv.2603.00496,
title = {A Polynomial-Time Axiomatic Alternative to SHAP for Feature Attribution},
author = {Kazuhiro Hiraki and Shinichi Ishihara and Takumi Kongo and Junnosuke Shino},
journal= {arXiv preprint arXiv:2603.00496},
year = {2026}
}
备注
28 pages, 4 figures, 2 tables. Code will be released