面向推理型大语言模型的LoRA安全对齐
人工智能
2026-02-03 v4
摘要
推理能力强大的大语言模型在解决复杂问题方面取得了重大进展,但近期的研究表明,获取和部署强大的推理能力会引入显著的安全风险。常见的缓解措施是在学习推理后应用次要的安全对齐阶段;然而,安全对齐通常会降低推理性能——这被称为"安全税"。在本工作中,我们表明一种简单方法即可大大规避这一权衡:在SFT阶段对拒绝数据集应用LoRA。尽管方法简单,但该配方在保持接近原始推理调优模型的推理性能的同时,实现了与全模型对齐相当的安全性能,且该结果在多个模型规模和架构、两个安全基准和四个覆盖数学、科学和代码生成的推理基准上都成立。我们进一步对LoRA配置进行消融实验,发现:(1)秩-1更新足以实现最佳的安全-推理权衡;(2)仅应用于MLP上投影层的LoRA可以优于更新整个MLP;(3)更新中间层比更新早期或晚期层更有效。最后,我们提供了理论分析,帮助理解LoRA何时以及为何有效,揭示了使用超过排名预算(对于微调任务使用更大的排名)会以与基础任务内在维度成反比的速率导致基础任务的退化。这表明LoRA在微调任务为低秩且基础能力为高秩时最为有效。
引用
@article{arxiv.2507.17075,
title = {LoRA is All You Need for Safety Alignment of Reasoning LLMs},
author = {Yihao Xue and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2507.17075},
year = {2026}
}