中文

有害意图作为 LLM 残差流的几何可恢复特征

机器学习 2026-05-12 v2 人工智能 计算与语言

摘要

对齐的语言模型会拒绝有害指令,但它们识别此类指令所依赖的表征不如其产生的行为那样得到充分刻画。在跨越四个架构家族(Qwen2.5、Qwen3.5、Llama-3.2、Gemma-3)和三种对齐变体(base、instruction-tuned、abliterated)的 12 个模型中,有害意图可从残差流激活中线性分离,参数规模从 0.5B 到 1.3B,并在 Qwen3.5 上进行了家族内 9B 规模的扩展。通过 Soft-AUC 优化从每类 100 个标注样本中拟合出的方向,达到了 0.982 的平均有效 AUROC 和 0.797 的 TPR@1%FPR,可泛化至三个留出危害基准测试和一个困难良性对照,并在已移除拒绝机制的 abliterated 变体中与其 instruction-tuned 对应物的 AUROC 偏差在 ±0.003\pm 0.003 以内。监督策略的 AUROC 均超过 0.96,但其 TPR@1%FPR 的差异超过 AUROC 差距的十倍;一个已部署的 9B 安全分类器表现出相同的模式,AUROC 为 0.94,TPR 为 0.30,这促使将低 FPR 报告作为安全相关检测评估的默认设置。几何测量进一步完善了这一图景。恢复出的方向在每种提取协议内是集中的,但在不同协议间依赖于协议:对同一残差流层的同一聊天模板化激活应用两种池化选择(对内容 token 进行最大池化与指令位置后的最后一个 token),恢复出的危害方向相差 7373^\circ,并且将其中一个投影剔除后,在任一最大池化提取下的检测基本保持不变。探针识别出的是一个特定于协议的方向,而非唯一的计算特征。

关键词

引用

@article{arxiv.2604.18901,
  title  = {Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams},
  author = {Isaac Llorente-Saguer},
  journal= {arXiv preprint arXiv:2604.18901},
  year   = {2026}
}

备注

26 pages, 1(+6) figures, 4(+14) tables. Code at https://github.com/isaac-6/harm-directions