头级诊断下的手术式对齐:安全性-实用性冲突并非全局问题
机器学习
2026-01-09 v1 人工智能
摘要
大型语言模型(LLM)的安全对齐本质上呈现为多目标优化冲突,常伴随通用能力的意外降低。现有缓解策略通常依赖全局梯度几何来解决这些冲突,但忽视了 Transformer 内部的模块异构性,即功能敏感性和冲突程度在不同注意力头之间存在显著差异。这种全局方法在所有参数上施加统一的更新规则,常导致对实用性敏感头进行不成比例的更新,从而产生次优的权衡。为此,我们提出了一种称为 Conflict-Aware Sparse Tuning(CAST)的框架,将头级诊断与稀疏微调相结合。CAST 首先通过综合优化冲突和功能敏感性构建对齐冲突图,然后据此指导参数的选择性更新。实验表明,LLM 中的对齐冲突并非均匀分布。我们发现,通用能力的下降主要来自更新少数“高冲突”头所致。仅跳过这些头即可在不牺牲安全性的前提下显著减少此损失,为改善安全性-实用性权衡提供了可解释且参数高效的方法。
引用
@article{arxiv.2601.04262,
title = {Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis},
author = {Wang Cai and Yilin Wen and Jinchang Hou and Du Su and Guoqiu Wang and Zhonghou Lv and Chenfu Bao and Yunfang Wu},
journal= {arXiv preprint arXiv:2601.04262},
year = {2026}
}