中文

ALERT:基于内部差异放大的零样本 LLM 越狱检测

机器学习 2026-01-08 v1 人工智能 信息检索

摘要

尽管拥有丰富的安全对齐策略,大型语言模型(LLM)仍高度易受越狱攻击的威胁,这些攻击会破坏安全警戒并构成严重的安全风险。现有的检测方法主要依赖训练数据中存在的越狱模板来检测越狱状态。然而,鲜有研究 addresses 更真实且具有挑战性的零样本越狱检测设置,即在训练期间无法获取任何越狱模板。这种设置更贴近实际场景,其中新的攻击不断出现并不断演变。为应对这一挑战,我们提出了一种基于层级、模块级和 token 级的放大框架,逐步放大良性提示与越狱提示之间内部特征的差异。我们发现与安全相关的层,识别编码零样本判别信号的特定模块,并定位信息丰富的安全 token。基于这些洞察,我们引入了 ALERT(Amplification-based Jailbreak Detector),一个高效且有效的零样本越狱检测器,通过在放大后的表征上引入两个独立且互补的分类器。对三个安全基准进行大量实验表明,ALERT 在零样本检测性能方面始终表现出色。具体而言,(i)在所有数据集和攻击策略下,ALERT 可靠地位列前两名,(ii)它至少比第二名基线提高了 10% 的平均准确率和 F1 分数,甚至在某些情况下提升最高可达 40%。

关键词

引用

@article{arxiv.2601.03600,
  title  = {ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification},
  author = {Xiao Lin and Philip Li and Zhichen Zeng and Tingwei Li and Tianxin Wei and Xuying Ning and Gaotang Li and Yuzhong Chen and Hanghang Tong},
  journal= {arXiv preprint arXiv:2601.03600},
  year   = {2026}
}