SafeSwitch:通过内部激活信号引导不安全的大语言模型行为
机器学习
2025-09-16 v5
摘要
大语言模型(LLM)在各类任务中展现出卓越的能力,但也会生成有害内容。现有安全机制虽然提升了模型安全性,却常导致过于谨慎,未能充分发挥LLM内部认知过程的潜力。灵感来源于人类反思性思维能力,本文首先表明LLM能够类似地对自身内部状态进行安全评估。基于此洞见,我们提出SafeSwitch——一种动态框架,通过利用基于探针的内部状态监控器主动检测有害意图,并在必要时激活安全头部,从而生成更安全、更保守的响应。SafeSwitch在面对有害查询时可将有害输出降低约80%,同时保持强大的实用性,达到多种方法的帕累托最优。该方法相较于传统方法还能提供更具信息性、情境感知的拒绝响应,且仅需调优不到6%的原始参数。SafeSwitch展示了大语言模型在安全方面的自我意识与反思能力,为实现更细粒度、更有效的安全控制提供了前景。本工作的代码已发布于https://github.com/Hanpx20/SafeSwitch。
引用
@article{arxiv.2502.01042,
title = {SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals},
author = {Peixuan Han and Cheng Qian and Xiusi Chen and Yuji Zhang and Heng Ji and Denghui Zhang},
journal= {arXiv preprint arXiv:2502.01042},
year = {2025}
}