中文

长上下文LLM的位置失效:推理基准的盲点

计算与语言 2026-05-25 v1 人工智能 机器学习

摘要

位置控制是检索类任务(如Needle-in-a-Haystack和RULER)的标准评估方式,但主流的推理基准未对目标任务在长上下文中的位置进行控制。我们审计了11个长上下文基准,发现没有一个基准同时控制了任务位置、填充内容和上下文长度。对四个主要长上下文版本的审计发现,NIAH、RULER或LongBench系列基准的主要结果表格条目均未出现,尽管代理类和编码类基准在所有四个版本的主要结果表格中都有出现。我们提出了Context Rot Evaluation(CRE),这是一种在三个因素上进行控制的框架,评估九个LLM在GSM8K和ARC-Challenge上的表现:包括初始的五个模型集合和四个更新的供应商版本。模型在目标任务从末端移动到中间时会出现显著下降,而该下降随上下文长度增加而加剧,受影响的模型表现更差。MiMo-v2-Flash在64K上使用with_solutions填充(中间准确率为8%)时准确率下降最高可达88个百分点。更新的版本显示较小的下降:在64K下,四个型号中有三个相对于末端位置准确率的波动在±6个百分点内;MiMo-V2.5-Pro将MiMo-v2-Flash的88个百分点下降缩小到32个百分点。在questions_only_v2填充下,中间位置的下降在所有四个型号中都持续存在(8K、32K、64K范围内为-16pp至-56pp)。在8K下,诊断探针在末端添加目标任务副本后,使中间位置准确率在所有九个模型中均在末端基准±4个百分点内,符合位置解释。初始五个模型集合中,76%的中间位置错误匹配周围填充文本,而在末端位置仅为22%,这符合填充答案干扰为主导错误模式。这些结果揭示了当前推理基准设计和供应商评估实践中的结构性评估缺口:当任务位置未被控制时,无法衡量随上下文长度增长而加剧的位置脆弱性。

引用

@article{arxiv.2605.23170,
  title  = {Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks},
  author = {Chuyifei Zhang and Hongyu Cui and Xiaowen Huang and Jitao Sang},
  journal= {arXiv preprint arXiv:2605.23170},
  year   = {2026}
}

备注

20 pages, 1 figure, 23 tables