中文

大语言模型残差流中角度偏差的有害意图几何:无需训练的异常检测

机器学习 2026-03-31 v1 人工智能 计算与语言

摘要

我们提出了 LatentBiopsy,这是一种通过分析大语言模型残差流激活的几何来检测有害提示的无需训练方法。给定 200 个安全规范性提示,LatentBiopsy 计算其激活在目标层的主成分,并通过其径向偏差角 θ 特征化新提示。异常得分是 θ 服从于对规范性分布的高斯拟合后的负对数似然,对偏差以对称方式进行标记。无需任何有害示例进行训练。我们评估了来自 Qwen3.5-0.8B 和 Qwen2.5-0.5B 系列的两个完整模型三元组:基础模型、指令调优模型和经手术切除拒绝方向的 abliterated 模型。在所有六个变体中,LatentBiopsy 对于有害-规范性检测的 AUROC ≥0.937,对于区分有害-良性攻击性提示(XSTest)的 AUROC = 1.000,查询开销亚毫秒。三个经验发现浮现。首先,几何存活于拒绝 ablation:两种 abliterated 变体的 AUROC 最多比其指令调优版本低 0.015,建立了有害意图表征与下游生成拒绝机制之间的几何解耦。其次,有害提示表现出近似退化的角度分布(σ_θ ≈ 0.03 rad),约为规范性分布(σ_θ ≈ 0.27 rad)的十倍,保持在所有对齐阶段包括 abliteration 中。第三,两个系列在相同深度处呈相反的环形定向:Qwen3.5-0.8B 中的有害提示占据外环,而 Qwen2.5-0.5B 中的有害提示占据内环,直接激发方向无关评分规则。

关键词

引用

@article{arxiv.2603.27412,
  title  = {The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams},
  author = {Isaac Llorente-Saguer},
  journal= {arXiv preprint arXiv:2603.27412},
  year   = {2026}
}

备注

20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data