面向 LLM 的分段层次连贯性:对恶意意图探测的稳健方法
计算与语言
2026-04-17 v1 密码学与安全
摘要
大语言模型(LLM)正日益暴露于适应性越狱攻击,尤其是在高风险的化学、生物、放射和核(CBRN)领域。尽管流式探测器实现了实时监控,但仍会产生系统性错误。我们识别出核心问题:现有方法常依赖少数高分数标记,导致在敏感 CBRN 术语出现于良性上下文时产生误报。为此,我们引入一种流式探测目标,要求多个证据标记持续支持预测,而非依赖孤立的尖峰。这鼓励基于聚合信号而非单标记线索进行更稳健的检测。在固定为 1% 假阳性率的条件下,我们的方法相对于强大的流式基线提高了 35.55% 的真阳性率。我们进一步观察到即便在接近饱和基线性能( AUROC=97.40%)的条件下,仍实现显著的 AUROC 提升。我们还显示,探测注意力或 MLP 激活持续优于残差流特征。最后,即便在对抗性微调启用新型字符级密码的情况下,恶意意图仍可被检测:针对基础 LLM 开发的探测器可直接插用到这些被混淆攻击中,实现超过 98.85% 的 AUROC。
引用
@article{arxiv.2604.14865,
title = {Segment-Level Coherence for Robust Harmful Intent Probing in LLMs},
author = {Xuanli He and Bilgehan Sel and Faizan Ali and Jenny Bao and Hoagy Cunningham and Jerry Wei},
journal= {arXiv preprint arXiv:2604.14865},
year = {2026}
}
备注
preprint