中文

spell 颠倒:基于秩一安全注入的轻量级对齐放大

计算与语言 2025-08-29 v1 人工智能 机器学习

摘要

大型语言模型(LLM)的安全对齐通常涉及调节内部表示以拒绝有害请求。最近的研究表明,这些安全机制可以通过削减或移除模型内部特定表示方向来被绕过。本文提出了相反的方法:Rank-One Safety Injection(ROSI),一种白盒方法,通过永久性地将激活引导至拒绝调制子空间来放大模型的安全对齐。ROSI作为一种简单、无需微调的秩一权重修改,应用于所有残差流写矩阵。所需的安全方向可从小型的有害和无害指令对中计算得出。我们表明,ROSI在提升拒绝率方面始终有效——其评估基于Llama Guard 3——同时在MMLU、HellaSwag和Arc等标准基准测试中保持实用性。此外,我们展示了ROSI还能通过放大模型自身潜在的安全方向来重新对齐“未封禁”模型,证明其作为有效最后一公里安全程序的实用性。我们的结果表明,针对性的、可解释的权重引导是一种廉价且高效的机制,用于提高LLM安全性,补充更资源密集的微调范式。

关键词

引用

@article{arxiv.2508.20766,
  title  = {Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection},
  author = {Harethah Abu Shairah and Hasan Abed Al Kader Hammoud and George Turkiyyah and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2508.20766},
  year   = {2025}
}

备注

Under Review