Safety Anchor:通过几何瓶颈防御有害微调
密码学与安全
2026-05-11 v2 人工智能
计算与语言
摘要
大型语言模型(LLM)的安全对齐仍然容易受到有害微调(HFT)的攻击。虽然现有防御措施对参数、梯度或内部表示施加约束,但我们观察到它们在持续性 HFT 下可能被有效规避。我们的分析将这种失败归因于高维参数空间固有的冗余性:攻击者利用与防御约束正交的优化轨迹,在虚假遵守安全限制的同时恢复有害能力。为此,我们提出了安全瓶颈正则化(SBR)。SBR 将防御重点从冗余参数空间转向作为几何瓶颈的解嵌入层,通过将有害查询的最终隐藏状态锚定到安全对齐模型的隐藏状态,实现即使在持续性 HFT 下也能保持安全响应。大量实验表明 SBR 有效,仅使用一个安全锚即可将有害分数降至 ,同时保持对良好下游任务的竞争性能。
引用
@article{arxiv.2605.05995,
title = {Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks},
author = {Guoxin Lu and Letian Sha and Qing Wang and Peijie Sun and Hao Zhou and Hua Dai and Fu Xiao},
journal= {arXiv preprint arXiv:2605.05995},
year = {2026}
}
备注
Accepted to ICML 2026