语言模型注意力缺陷:程序性幻觉的因果解释
机器学习
2026-02-24 v1 机器学习
摘要
大型语言模型能够遵循复杂程序,却在看似简单的最终步骤——报告其数秒前计算的值——时会失败。我们将此现象研究为“程序性幻觉”:即使正确值已存在于上下文中,模型仍会失败,未能执行可验证的、以提示为依据的规范。在单 token 候选集已知的长程绑定任务中,我们发现许多错误为读出阶段的路由失败。具体而言,失败可分为 Stage~2A(门控)错误——模型未进入答案模式;以及 Stage~2B(绑定)错误——模型进入答案模式但选择错误的候选值(常因近频偏差)。在困难情境下,Stage~2B 错误在诸多模型家族中占据大多数错误(表~1)。在 Stage~2B 错误试验中,对最终层残差流的线性探针可显著高于随机恢复正确值(例如 Qwen2.5-3B 上为 74% vs. 2%;表~2),表明答案被编码但未被使用。我们通过可用信息与已用信息的相互信息以及伪先验干预,形式化“存在却未被使用”,从而得到可计算的诊断工具和信息预算证书。最后,一种先验检查点干预——在查询附近重述真实绑定——可几乎消除长距离的 Stage~2B 失败(例如 Qwen2.5-3B 在 时;表~8)。
引用
@article{arxiv.2602.19239,
title = {Attention Deficits in Language Models: Causal Explanations for Procedural Hallucinations},
author = {Ahmed Karim and Fatima Sheaib and Zein Khamis and Maggie Chlon and Jad Awada and Leon Chlon},
journal= {arXiv preprint arXiv:2602.19239},
year = {2026}
}