通过选择性几何控制重访大语言模型安全对齐的鲁棒性
机器学习
2026-05-22 v2
摘要
大型语言模型的安全对齐在域迁移和噪声偏好监督下仍然脆弱。大多数现有鲁棒对齐方法关注对齐数据的不确定性,却忽略了基于偏好目标中由优化引起的脆弱性。本文从优化几何的角度重新审视大语言模型安全对齐的鲁棒性,认为仅靠数据中心方法无法解决鲁棒性问题。我们提出了\textit{ShaPO},一种几何感知的偏好优化框架,通过对关键参数子空间上的选择性几何控制来强制执行最坏情况对齐目标。通过避免统一的几何约束,ShaPO缓解了在分布迁移下可能损害鲁棒性的过正则化。我们在两个层面上实例化ShaPO:token级ShaPO稳定基于似然的代理优化,reward级ShaPO在噪声监督下强制执行奖励一致的优化。跨越 diverse safety benchmarks 和噪声偏好设置,ShaPO始终在流行的偏好优化方法上提高了安全鲁棒性。此外,ShaPO与数据鲁棒目标可以无缝组合,获得额外的提升,并经验性地支持了所提出的优化几何视角。代码可在 https://github.com/liujilong0116/ShaPO 获取。
引用
@article{arxiv.2602.07340,
title = {Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control},
author = {Yonghui Yang and Wenjian Tao and Jilong Liu and Xingyu Zhu and Junfeng Fang and Weibiao Huang and Le Wu and Richang Hong and Tat-Sent Chua},
journal= {arXiv preprint arXiv:2602.07340},
year = {2026}
}