中文

SafeSwitch:通过内部激活信号引导不安全的大语言模型行为

机器学习 2025-09-16 v5

摘要

大语言模型(LLM)在各类任务中展现出卓越的能力,但也会生成有害内容。现有安全机制虽然提升了模型安全性,却常导致过于谨慎,未能充分发挥LLM内部认知过程的潜力。灵感来源于人类反思性思维能力,本文首先表明LLM能够类似地对自身内部状态进行安全评估。基于此洞见,我们提出SafeSwitch——一种动态框架,通过利用基于探针的内部状态监控器主动检测有害意图,并在必要时激活安全头部,从而生成更安全、更保守的响应。SafeSwitch在面对有害查询时可将有害输出降低约80%,同时保持强大的实用性,达到多种方法的帕累托最优。该方法相较于传统方法还能提供更具信息性、情境感知的拒绝响应,且仅需调优不到6%的原始参数。SafeSwitch展示了大语言模型在安全方面的自我意识与反思能力,为实现更细粒度、更有效的安全控制提供了前景。本工作的代码已发布于https://github.com/Hanpx20/SafeSwitch。

关键词

引用

@article{arxiv.2502.01042,
  title  = {SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals},
  author = {Peixuan Han and Cheng Qian and Xiusi Chen and Yuji Zhang and Heng Ji and Denghui Zhang},
  journal= {arXiv preprint arXiv:2502.01042},
  year   = {2025}
}