中文

图正则化稀疏自编码器用于LLM安全引导

机器学习 2026-05-18 v3 人工智能

摘要

稀疏自编码器(SAE)越来越多地用于提取推理时引导的激活方向,但其标准稀疏性目标将潜在特征视为独立的。这一先验可能与高级安全行为不匹配,在这些行为中,拒绝和有害遵从似乎依赖于激活空间中的分布式结构。我们提出了图正则化稀疏自编码器(GSAE),一种字典学习方法,通过在神经元共激活图上平滑SAE解码器向量来学习安全引导方向,并通过双门运行时控制器应用所得方向库。经验上,GSAE在JailbreakBench、HarmBench和XSTest上提高了选择性拒绝能力,在保持良性提示拒绝率低的同时增加了有害请求拒绝率。在Llama-3-8B上,用GSAE替换标准SAE(在其他方面完全相同的流水线中)在JailbreakBench上将Δs提高了20.1点,在HarmBench上提高了16.8点。GSAE优于激活引导基线和黑盒护栏,保持了良性任务性能,在Llama-3、Mistral、Qwen 2.5和Phi-4之间泛化,并且在黑盒和灰盒越狱攻击下仍然保持强劲。

关键词

引用

@article{arxiv.2512.06655,
  title  = {Graph-Regularized Sparse Autoencoders for LLM Safety Steering},
  author = {Jehyeok Yeon and Federico Cinus and Yifan Wu and Luca Luceri},
  journal= {arXiv preprint arXiv:2512.06655},
  year   = {2026}
}