将安全性解耦至正交子空间:面向大语言模型的高效且性能保持的对齐方法
计算与语言
2025-10-13 v1
摘要
安全对齐对于构建可信人工智能至关重要,然而在不降低通用性能的情况下增强模型安全性仍然具有挑战性。当前方法需要针对安全关键数据和通用目的数据的最优比例进行计算代价高昂的搜索,以平衡安全性和通用性能,带来了高成本和有限的收益。在本工作中,我们表明基于 LoRA 的拒绝训练能够在仅使用安全数据进行训练时实现性能保持的安全对齐,证明了 LoRA 作为高效、性能保持且即插即用的安全补丁的作用。除了经验发现外,我们提供了理论和实验证据,表明 LoRA 有效地将安全性解耦到与模型固有变换空间 largely 正交的低秩子空间,确保安全增强不会干扰固有能力。
引用
@article{arxiv.2510.09004,
title = {Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models},
author = {Yutao Mou and Xiaoling Zhou and Yuxiao Luo and Shikun Zhang and Wei Ye},
journal= {arXiv preprint arXiv:2510.09004},
year = {2025}
}
备注
Work in Progress