中文

少量标记,大幅提升:通过约束安全标记保持安全对齐

计算与语言 2026-03-10 v1 机器学习

摘要

大型语言模型(LLM)通常需要进行微调以适应下游任务,但微调即使仅使用良性数据也会导致安全对齐偏移。先前工作表明,引入少量有害数据可显著损害LLM的拒绝行为,使LLM屈从于有害请求。现有防御方法常依赖模型范围的干预,如限制更新哪些参数或注入额外安全数据,这会限制普适性并降低下游任务性能。为解决这些限制,我们提出一种称为保护安全对齐通过受限标记(PACT)的微调框架,通过约束安全标记的置信度来稳定模型行为。我们的方法基于经验观察:安全对齐行为体现在模型的标记级输出置信度,且常集中在少数安全相关标记上。在下游微调期间,我们对模型在每个响应步骤上对安全相关标记的置信度进行正则化,使其匹配对齐参考模型的置信度,而对非安全标记则基本不受约束,以允许有效的任务适应。这种针对性约束可在不施加全局限制的情况下防止对齐偏移,而这些全局限制通常以牺牲模型实用性为代价。

关键词

引用

@article{arxiv.2603.07445,
  title  = {Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning},
  author = {Guoli Wang and Haonan Shi and Tu Ouyang and An Wang},
  journal= {arXiv preprint arXiv:2603.07445},
  year   = {2026}
}