中文

归因盲点:检测语言模型何时依赖记忆而非检索到的上下文

人工智能 2026-05-27 v1

摘要

检索增强生成有望将语言模型输出锚定在外部证据上,然而该领域尚无可靠的方法来验证检索到的上下文是否真正主导了生成过程——这是任何高风险部署的先决条件。当检索到的文档与模型的预训练数据重叠时,标准的假设(即上下文一致的输出意味着上下文主导的输出)就会失效:模型可以完全从参数化记忆中生成看似忠实的文本,而这两种路径会产生难以区分的输出。我们将这种失败命名为归因盲点,并引入计算现实监控(CRM)来解决它。CRM 将源自认知科学现实监控框架的一个原则付诸实践:比较有上下文和无上下文时的内部表征,会发现基于成员关系的表征差异,而输出层面的监控系统会系统地忽略这种差异。CRM 并不证明单个生成使用了哪个来源;它检测预训练暴露是否留下了可测量的内部轨迹特征,从而为来源归因建立了必要的基质。在跨越三个系列的九个模型变体上,这种差异集中在特定架构的层模式中,得到了块级噪声干预的汇聚支持,并在任务和数据集上泛化,同时在领域混淆的基准测试上失效。归因盲点是可以测量的,并且可以部分解决:内部表征携带了输出层面不可见的诊断信号,这为那些对证据来源的内部感知支配其外部行为的系统奠定了基础。

关键词

引用

@article{arxiv.2605.26778,
  title  = {The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context},
  author = {Zhe Yu and Wenpeng Xing and Yunzhao Wei and Bo Yang and Chen Ye and Gaolei Li and Meng Han},
  journal= {arXiv preprint arXiv:2605.26778},
  year   = {2026}
}