kNNGuard:将 LLM 隐藏激活转化为免训练的可配置护栏
机器学习
2026-07-02 v1 人工智能
密码学与安全
摘要
大型语言模型(LLM)越来越多地部署在需要护栏来检测不安全、离题或对抗性提示的领域。现有的护栏主要依赖微调来构建分类器,这通常存在泛化能力低和推理延迟高的问题。我们提出了 kNNGuard,一种免训练的护栏,它利用现成 LLM 的激活空间。给定一个包含 50 个安全和不安全提示的小型库,kNNGuard 提取隐藏激活,并执行多层 kNN,融合激活空间和嵌入空间的分数进行分类。在涵盖主题和安全提示的六个领域中,与微调的最先进护栏相比,kNNGuard 取得了具有竞争力或更优的 F1 分数,同时运行速度比最佳可比护栏快 2.7 倍,比微调的安全分类器快 10 倍,且无需梯度更新或微调。领域适应只需更新标记库,可在 10 秒内构建,比已建立的护栏快几个数量级。我们还分析了系统提示、层选择以及作为可配置、低延迟护栏集成到生产 LLM 管道中的影响。
引用
@article{arxiv.2607.02072,
title = {kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail},
author = {Mahmoud Abdelfattah and Hamid Nasiri and Peter Garraghan},
journal= {arXiv preprint arXiv:2607.02072},
year = {2026}
}
备注
17 pages, 11 figures