中文

超越针具错觉:语义干扰下证据访问与使用的解耦评估——3.26 亿 Token 规模

计算与语言 2026-01-29 v1 人工智能

摘要

长上下文 LLM 代理必须从大规模环境中获取正确证据并可靠地加以利用。然而,流行的针具- haystack(NIAH)评估主要衡量良性文本定位,针具较为独特,haystack 内容大多不相关。我们引入 EverMemBench-S(EMB-S),这是一套基于 3.26 亿 Token MemoryBank 的对抗式 NIAH 风格基准测试。虽然完整的 MemoryBank 规模为 3.26 亿 Token 用于检索-生成(RAG)评估,但我们仅在每个模型上下文窗口能容纳的规模(本工作中最高可达 100 万 Token)下评估原生长上下文模型,以确保公平比较。EMB-S 将查询与经 collision 测试的近似难负样本和跨越一或多个文档的金标准证据集合配对,通过人工筛选和 LLM 验证。我们还提出了一种解耦诊断协议,分别报告证据访问(文档 ID 定位)和在全上下文提示下的端到端 QA 质量。这使得对原生长上下文提示和检索管道都能进行一致诊断。在从领域隔离的 64K 上下文到全球共享的 3.26 亿 Token 环境的参考语料梯度上,我们观察到明显的现实差距。在语义干扰下,饱和良性 NIAH 的系统表现会显著下降。这表明语义辨识能力,而非上下文长度本身,是长上下文记忆规模化的主要瓶颈。

关键词

引用

@article{arxiv.2601.20276,
  title  = {Beyond the Needle's Illusion: Decoupled Evaluation of Evidence Access and Use under Semantic Interference at 326M-Token Scale},
  author = {Tianwei Lin and Zuyi Zhou and Xinda Zhao and Chenke Wang and Xiaohong Li and Yu Chen and Chuanrui Hu and Jian Pei and Yafeng Deng},
  journal= {arXiv preprint arXiv:2601.20276},
  year   = {2026}
}