中文

语言模型如何处理分布外输入:一个双通道框架

计算与语言 2026-05-04 v1 机器学习

摘要

最近的 white-box OOD 检测方法对于 LLM —— 包括 CED、RAUQ 和 WildGuard 置信度得分 —— 看似有效,但我们展示它们在结构上受序列长度(|r| >= 0.61)的 confound 影响,并在长度匹配的评估下退化为近乎随机。即便是原始注意力熵(跨头和层的平均 H(alpha)),我们为完整性包含了一个自然的基线,也表现出相同的 confound。该 confound 源于注意力对输入长度的 Theta(log T) 依赖。为了在去 confound 后识别真正的 OOD 信号,我们提出了一个双通道框架:嵌入捕获文本内容(针对主题迁移有效),而处理轨迹 —— 跨层的隐藏状态演化 —— 捕获模型如何处理输入。每个通道的相对性能沿着 vocabulary-transparency 谱系变化:嵌入方法在 vocabulary-distinctive OOD 上表现突出,而轨迹特征能检测到共享词汇但意图隐蔽的输入(0.721 avg AUROC;Jailbreak: 0.850)。三个证据线支持这一框架:(1)在6个任务上的 k-NN 与轨迹评分之间的 crossover,每个通道在不同 OOD 类型上各占优势;(2)逐层分析显示,layer-0 k-NN 信号几乎完全是长度 artifacts(Jailbreak: 0.759 raw -> 0.389 matched)——处理构造了来自近乎随机嵌入的真正 OOD 信号;(3)circuit attribution 显示,对抗任务更激活注意力 circuits 而非语义任务(p = 0.022;Jailbreak patching p < 0.001),并实现了部分跨模型复制。代码将在发布时公开。

关键词

引用

@article{arxiv.2605.00269,
  title  = {How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework},
  author = {Hamidreza Saghir},
  journal= {arXiv preprint arXiv:2605.00269},
  year   = {2026}
}

备注

30 pages, 3 figures, 30+ tables. Submitted to COLM 2026