中文

Logit空间中的护栏:用于大语言模型对齐的安全令牌正则化

机器学习 2026-04-21 v1

摘要

在新领域微调对齐良好的大型语言模型(LLM)通常会降低其安全对齐性,即使使用良性数据集也是如此。现有的安全对齐技术主要关注预训练,使得微调后的模型容易受到行为偏移的影响。在这项工作中,我们引入了安全令牌正则化(STR),这是一种轻量级方法,旨在微调期间保持安全属性。我们的方法从对齐良好的模型的拒绝模板中识别出显著令牌,并在训练期间约束其相关的logits,防止关键安全行为的丢失。与强化学习或偏好优化方法不同,STR需要最少的额外计算,并能与参数高效微调技术(如LoRA)无缝集成。全面的实验表明,我们的方法在安全性能上达到了与最先进方法相当的水平,同时保留了任务特定的效用,并且实现开销最小。此外,我们证明安全令牌正则化不仅限于安全考虑,还能增强训练稳定性和整体性能。这项工作为微调LLM中的持续安全对齐提供了一种实用且易于部署的策略。

关键词

引用

@article{arxiv.2604.17210,
  title  = {Guardrails in Logit Space: Safety Token Regularization for LLM Alignment},
  author = {Thong Bach and Truyen Tran},
  journal= {arXiv preprint arXiv:2604.17210},
  year   = {2026}
}

备注

10 pages, 3 figures