超越线性探针:面向语言模型的动态安全监测
机器学习
2026-04-22 v4
摘要
监测大型语言模型(LLM)的激活状态是在其产生不安全输出前检测有害请求的有效方法。然而,传统的安全监测器通常对每个查询都需要相同的计算量。这造成了一种权衡:昂贵的监测器在简单输入上浪费资源,而廉价的监测器则可能遗漏细微情况。我们认为安全监测器应是灵活的——其成本应仅在输入难以评估或可用计算资源更多时才增加。为此,我们引入了截断多项式分类器(TPC),这是线性探针在动态激活监测中的一种自然扩展。我们的核心见解是,多项式可以逐项进行训练和评估。在测试时,可以提前停止以实现轻量级监测,或在需要时使用更多项来提供更强的防护。TPC提供两种使用模式。首先,作为安全调节器:通过评估更多项,开发者和监管者可以从同一模型中“购买”更强的防护能力。其次,作为自适应级联:清晰案例在低阶检查后提前退出,而高阶防护仅在输入模糊时才被评估,从而降低总体监测成本。在WildGuardMix数据集上,针对多达4个、参数量高达30B的模型,我们表明,对于有害提示分类任务,TPC的性能可与同等规模的基于MLP的探针基线相媲美或更优,同时比其黑箱对应物更具可解释性。我们的代码可在 http://github.com/james-oldfield/tpc 获取。
引用
@article{arxiv.2509.26238,
title = {Beyond Linear Probes: Dynamic Safety Monitoring for Language Models},
author = {James Oldfield and Philip Torr and Ioannis Patras and Adel Bibi and Fazl Barez},
journal= {arXiv preprint arXiv:2509.26238},
year = {2026}
}
备注
ICLR 2026; Minor revisions and clarifications