中文

从内部表示检测有害内容:LLM安全的内部方法

人工智能 2026-04-21 v1

摘要

守卫模型广泛用于检测用户提示和 LLM 回复中的有害内容。然而,现代守卫模型仅依赖终端层表示,忽略了分布在内部层中丰富的安全相关特征。我们提出 SIREN,一种轻量级守卫模型,利用这些内部特征。通过通过线性探测识别安全神经元并通过自适应层加权策略将其组合,SIREN 在不修改底层模型的情况下,从 LLM 内部构建一个有害检测器。我们的全面评估表明,SIREN 在多个基准测试中显著优于最先进的开源守卫模型,同时使用了 250 倍更少的可训练参数。此外,SIREN 对未见基准测试表现出优异的泛化能力,自然支持实时流式检测,并且在生成式守卫模型之外显著提高了推理效率。总体而言,我们的结果凸显了 LLM 内部状态作为实用、高性能有害检测基础的前景。

关键词

引用

@article{arxiv.2604.18519,
  title  = {LLM Safety From Within: Detecting Harmful Content with Internal Representations},
  author = {Difan Jiao and Yilun Liu and Ye Yuan and Zhenwei Tang and Linfeng Du and Haolun Wu and Ashton Anderson},
  journal= {arXiv preprint arXiv:2604.18519},
  year   = {2026}
}

备注

17 pages,10 figures,6 tables