安全对齐权重不够:基于拒绝教师引导的微调提升安全性与下游性能
计算与语言
2025-10-14 v2
摘要
最近,Google和OpenAI等主要AI提供商推出了所谓的微调即服务(FaaS)模式,允许用户使用自有数据对大语言模型(LLM)进行定制化。然而,这一服务在用户数据包含有害提示时容易导致模型安全性能下降,这种威胁被称为有害微调攻击。以往的做法是首先构建安全对齐模型,再在用户数据上进行微调。但我们观察到,安全对齐权重为下游任务学习提供的初始化较弱,导致模型在安全对齐和下游任务性能方面均表现次佳。为此,我们提出一种拒绝教师(Ref-Teacher)引导的微调框架。该方法不再在用户数据上对安全对齐模型进行微调,而是直接在安全对齐的Ref-Teacher的指导下对基础模型进行微调,Ref-Teacher会筛选用户数据中的有害提示,并将安全对齐知识蒸馏到基础模型中。大量实验表明,我们的Ref-Teacher引导微调策略能有效最小化有害输出,同时提升用户特定任务的微调准确率,为FaaS场景下LLM的安全可靠部署提供了实用方案。
引用
@article{arxiv.2506.07356,
title = {Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks},
author = {Seokil Ham and Yubin Choi and Yujin Yang and Seungju Cho and Younghun Kim and Changick Kim},
journal= {arXiv preprint arXiv:2506.07356},
year = {2025}
}