Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
机器学习
2025-07-29 v3 人工智能
计算与语言
摘要
大型语言模型 (LLM) 已成为实际应用中不可或缺的工具,但其广泛采用引发了重大的安全问题,尤其是在回应社会有害问题方面。尽管通过对齐工作显著提高了模型的安全性,但对齐后的模型仍可能因后续微调而受到安全保护的削弱——即使额外的训练数据看起来是良性的。在本文中,我们经验性地证明,这一脆弱性源于 LLM 参数中安全关键低秩子空间对微调的敏感性。基于这一洞察,我们提出了一种 novel 的 training-free 方法,称为 Low-Rank Extrapolation (LoX),通过对对齐 LLM 的安全子空间进行外推来增强安全鲁棒性。我们的实验结果确认 LoX 的有效性,证明其在抵御良性和恶意微调攻击方面显著提高了鲁棒性,同时保持了模型对新任务的适应性。例如,LoX 能将面对良性或恶意微调攻击的攻击成功率 (ASR) 降低 11% 至 54%。通过调查参数的 ASR 区域, 我们将 LoX 成功归因于外推将 LLM 参数移动到更平坦的区域,从而降低了对扰动的敏感性。代码已在 github.com/VITA-Group/LoX 上提供。
引用
@article{arxiv.2506.15606,
title = {LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning},
author = {Gabriel J. Perin and Runjin Chen and Xuxi Chen and Nina S. T. Hirata and Zhangyang Wang and Junyuan Hong},
journal= {arXiv preprint arXiv:2506.15606},
year = {2025}
}