中文

缓解大语言模型微调中对齐丧失的担忧

密码学与安全 2025-04-15 v1

摘要

大语言模型(LLMs)已展现出在理解复杂上下文和执行广泛任务方面的革命性能力。然而,大语言模型也可能回答不道德或有害的问题,引发了对其应用的担忧。为了规范大语言模型对此类问题的响应,一种称为\textit{对齐}的训练策略可以提供帮助。然而,在针对下游任务对大语言模型进行微调时,对齐可能会被意外破坏。本文聚焦于恢复在微调过程中丧失的对齐能力。我们观察到对齐后的大语言模型中存在两个不同的方向:\textit{对齐方向}与\textit{有害方向}。大语言模型倾向于沿对齐方向回答问题,而拒绝沿有害方向的查询。因此,我们提出恢复被破坏的微调模型的有害方向。具体而言,我们使用梯度下降从原始对齐模型中恢复微调模型权重参数的一个小子集。我们还引入了一种回滚机制,以避免激进的恢复并维持下游任务的性能。我们对 125 个微调后的大语言模型进行的评估表明,我们的方法能够将其有害回答率(回答有害问题的百分比)从 33.25% 降低到 1.74%,且不会显著牺牲任务性能。相比之下,现有方法要么仅能将有害率降低有限幅度,要么会显著影响正常功能。我们的代码可在 https://github.com/kangyangWHU/LLMAlignment 获取。

关键词

引用

@article{arxiv.2504.09757,
  title  = {Alleviating the Fear of Losing Alignment in LLM Fine-tuning},
  author = {Kang Yang and Guanhong Tao and Xun Chen and Jun Xu},
  journal= {arXiv preprint arXiv:2504.09757},
  year   = {2025}
}