中文

Safety Anchor:通过几何瓶颈防御有害微调

密码学与安全 2026-05-11 v2 人工智能 计算与语言

摘要

大型语言模型(LLM)的安全对齐仍然容易受到有害微调(HFT)的攻击。虽然现有防御措施对参数、梯度或内部表示施加约束,但我们观察到它们在持续性 HFT 下可能被有效规避。我们的分析将这种失败归因于高维参数空间固有的冗余性:攻击者利用与防御约束正交的优化轨迹,在虚假遵守安全限制的同时恢复有害能力。为此,我们提出了安全瓶颈正则化(SBR)。SBR 将防御重点从冗余参数空间转向作为几何瓶颈的解嵌入层,通过将有害查询的最终隐藏状态锚定到安全对齐模型的隐藏状态,实现即使在持续性 HFT 下也能保持安全响应。大量实验表明 SBR 有效,仅使用一个安全锚即可将有害分数降至 <10<10,同时保持对良好下游任务的竞争性能。

关键词

引用

@article{arxiv.2605.05995,
  title  = {Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks},
  author = {Guoxin Lu and Letian Sha and Qing Wang and Peijie Sun and Hao Zhou and Hua Dai and Fu Xiao},
  journal= {arXiv preprint arXiv:2605.05995},
  year   = {2026}
}

备注

Accepted to ICML 2026