中文

SafeMERGE:通过选择性层级模型合并保持安全对齐

计算与语言 2026-04-24 v3 人工智能

摘要

微调大型语言模型(LLM)是一种常见的做法,用于将通用模型适应特定领域。然而,近期研究表明,微调可能会消除安全对齐,导致 LLM 对有害或不道德的提示作出回应。许多方法已提出以重新对齐安全,但往往会引入难以实现的定制算法或妥协任务实用性。在本工作中,我们提出 SafeMERGE,一个轻量级、后微调框架,在保持下游性能的同时恢复安全性。SafeMERGE 在仅当其层级偏离安全行为时才选择性地合并微调后的层级,这通过余弦相似性准则进行衡量。在四个 LLM 和多个任务上,SafeMERGE 一致地减少了有害输出,同时对实用性几乎没有影响甚至可能是积极的。我们的结果表明,选择性、层级的合并提供了一种稳健的防御措施,以防止在微调期间意外丢失安全性,使 SafeMERGE 成为一个简单而有效的后微调防御机制。

关键词

引用

@article{arxiv.2503.17239,
  title  = {SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging},
  author = {Aladin Djuhera and Swanand Ravindra Kadhe and Farhan Ahmed and Syed Zawad and Holger Boche},
  journal= {arXiv preprint arXiv:2503.17239},
  year   = {2026}
}