中文

LSSF:面向大语言模型的低秩安全子空间融合安全对齐方法

计算机与社会 2026-02-03 v1 人工智能

摘要

大语言模型(LLM)的安全机制存在显著脆弱性,即使在无有害内容的数据集上微调,仍可能削弱其安全能力。同时,现有的安全对齐方法主要依赖微调过程,导致复杂度和计算资源需求增加。为解决此问题,本文引入LSSF(Low-Rank Safety Subspace Fusion),一种新的安全再对齐框架。我们的方法通过利用大语言模型中安全信息的低秩特性,构建低秩投影矩阵以提取安全向量的主成分。值得注意的是,该投影矩阵代表了大语言模型的低秩安全子空间,我们观察到该子空间在微调过程中保持稳定,且与模型的通用能力相互独立。这些主成分可通过线性算术与微调后的大语言模型相结合,以有效恢复安全对齐。此外,为考虑不同层级中安全信息编码密度的差异,本文提出了一种新型指标——安全奇异值熵。该指标量化了编码密度,允许为每个安全向量动态计算安全关键秩。大量实验表明,我们提出的后处理对齐方法能够在不显著影响下游任务性能的前提下,有效恢复微调后模型的安全对齐能力。

关键词

引用

@article{arxiv.2602.00038,
  title  = {LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion},
  author = {Guanghao Zhou and Panjia Qiu and Cen Chen and Hongyu Li and Mingyuan Chu and Xin Zhang and Jun Zhou},
  journal= {arXiv preprint arXiv:2602.00038},
  year   = {2026}
}

备注

Accepted in ACL 2025 Main Conference