中文

在最后一个标记之前:诊断最终标记安全探针失败

机器学习 2026-05-14 v1

摘要

最终标记安全探针在提示预填后监控单个隐藏状态,但越狱提示可能包含分布在早期用户标记表示中的探针可见不安全证据,而该读数会忽略这些证据。我们使用 SafeSwitch 风格的探针在三个指令调优 LLM 上仅在干净有害和良好提示上进行训练,研究这种预填时间的失败模式。探针在干净有害提示上实现高召回率,但会漏掉许多越狱尝试并在安全相邻的良好提示上产生误报。子空间分析表明,遗漏的越狱尝试与干净良好提示在表示子空间中捕获的方向上存在差异,增加探针瓶颈宽度并不能可靠地解决这一不匹配。标记级别的预填分析揭示,探针可见的不安全证据通常出现在序列的早期,但在最终标记读数中未被暴露,而对标记位置进行简单的最大池化会在安全提示上产生过度触发。一种简单的 PCA-HMM 轨迹模型仅在同一干净分割上进行训练,即可从用户内容预填轨迹中恢复许多最终标记漏检,而不像简单标记池化那样产生灾难性的误报,动机提示在诊断性地补充最终标记探针的隐藏状态分析。

关键词

引用

@article{arxiv.2605.12726,
  title  = {Before the Last Token: Diagnosing Final-Token Safety Probe Failures},
  author = {Shravan Doda},
  journal= {arXiv preprint arXiv:2605.12726},
  year   = {2026}
}

备注

8 pages, 2 figures, 7 tables