潜在对抗检测:自适应探测 LLM 激活值以进行多轮攻击检测
密码学与安全
2026-05-01 v1 人工智能
摘要
多轮提示注入遵循一条已知的攻击路径——建立信任、转向、升级,但文本级防御会遗漏那些单轮看似无害的隐蔽攻击。我们证明,这条攻击路径在模型的残差流中留下了激活值层面的特征:每次阶段转换都会移动激活值,产生的总路径长度远超良性对话。我们称之为对抗性不安定。捕捉此信号的五个标量轨迹特征将合成留出数据上的对话级检测率从 76.2% 提升至 93.8%。该信号在四个模型家族(24B-70B)中复现;探针是模型特定的,不能跨架构迁移。泛化能力依赖于数据源:留一源评估显示,合成数据、LMSYS-Chat-1M 和 SafeDialBench 各自捕获了不同的攻击分布,当真实世界 LMSYS 的分布被包含在训练中时,其检测率达到 47-71%。三源组合训练在留出的混合数据集上以 2.4% 的假阳性率实现了 89.4% 的检测率。我们进一步表明,我们合成数据集独有的三阶段轮次级标签(良性/欺骗性/对抗性)至关重要:二元的对话级标签会产生 50-59% 的假阳性。这些结果确立了对抗性不安定性作为一种可靠的激活级信号,并刻画了实际部署的数据需求。
引用
@article{arxiv.2604.28129,
title = {Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection},
author = {Prashant Kulkarni},
journal= {arXiv preprint arXiv:2604.28129},
year = {2026}
}