中文

表面安全对齐假设

计算与语言 2026-03-16 v3 人工智能 密码学与安全 计算机与社会 机器学习

摘要

随着大型语言模型(LLM)在 various applications 中被大量集成,确保其生成安全响应已成为迫切需要。先前在对齐方面的研究主要聚焦于通用指令遵循,但常常忽视了安全对齐的独特属性,如安全机制的脆弱性。为弥合这一差距,我们提出了表面安全对齐假设(SSAH),该假设认为,安全对齐教导一个原本不安全的模型选择正确的推理方向——履行或拒绝用户请求——可被解释为一个隐式的二元分类任务。通过 SSAH,我们假设只有少数关键组件才能在 LLM 中建立安全防线。我们成功识别了四类属性关键组件:安全关键单元(SCU)、效用关键单元(UCU)、复杂单元(CU)和冗余单元(RU)。我们的发现表明,在微调期间冻结某些安全关键组件后,模型能够在适应新任务的同时保留其安全属性。同样,我们展示了将预训练模型中利用冗余单元作为“对齐预算”可以有效最小化对齐成本,同时实现对齐目标。综上所述,本文得出结论,LLM 中实现安全的原子功能单元位于神经元水平,并强调安全对齐不应复杂化。我们在项目网站上提供了代码实现及其他信息:https://ssa-h.github.io/。

关键词

引用

@article{arxiv.2410.10862,
  title  = {Superficial Safety Alignment Hypothesis},
  author = {Jianwei Li and Jung-Eun Kim},
  journal= {arXiv preprint arXiv:2410.10862},
  year   = {2026}
}

备注

ICLR 2026