中文

固定残差流线性引导是否可解码却无法纠正:来自医学LLM失败情形的证据

人工智能 2026-05-08 v1 计算与语言 机器学习

摘要

线性可解码的LLM隐藏状态中的失败信号能否被用于纠正这些失败?我们通过Overthinking (OT)——一种稳定的行为情形(Jaccard >= 0.81, 94% 注释员一致性)进行分类-纠正间隙的探讨。在该情形中,模型在重抽样时正确作答,但在延长链式思考时失败。OT在71.6%的平衡准确率下可被线性解码(p < 10^{-16})。然而,五类固定线性引导(29种配置,n=1,273)均yield Delta ~= 0,跨架构(Qwen2.5-7B)和跨领域(MMLU-STEM)均呈相同空结果。三线收敛证据暗示表征纠缠:OT方向与任务关键计算有85-88%的重叠(特异度比 <= 0.152);非靶向共享方向引导损害准确率(-12.1pp);LEACE概念抹除损害准确率(-3.6pp, p=0.01),而10次随机抹除产生Delta=+0.3pp。单实例探针-引导相关性为r=-0.002(p=0.97)。从正面看,同一探针可实现选择性放弃(held-out AUROC=0.610,超过所有五种不确定性基线,p=0.009):可解码的失败结构支持后生成可靠性估计,即使固定线性引导家族无法利用它进行纠正。

关键词

引用

@article{arxiv.2605.05715,
  title  = {Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes},
  author = {Ming Liu},
  journal= {arXiv preprint arXiv:2605.05715},
  year   = {2026}
}

备注

22 pages (14 main + 8 appendix), 5 figures, 7 tables. Under review