超越针具错觉:语义干扰下证据访问与使用的解耦评估——3.26 亿 Token 规模
计算与语言
2026-01-29 v1 人工智能
摘要
长上下文 LLM 代理必须从大规模环境中获取正确证据并可靠地加以利用。然而,流行的针具- haystack(NIAH)评估主要衡量良性文本定位,针具较为独特,haystack 内容大多不相关。我们引入 EverMemBench-S(EMB-S),这是一套基于 3.26 亿 Token MemoryBank 的对抗式 NIAH 风格基准测试。虽然完整的 MemoryBank 规模为 3.26 亿 Token 用于检索-生成(RAG)评估,但我们仅在每个模型上下文窗口能容纳的规模(本工作中最高可达 100 万 Token)下评估原生长上下文模型,以确保公平比较。EMB-S 将查询与经 collision 测试的近似难负样本和跨越一或多个文档的金标准证据集合配对,通过人工筛选和 LLM 验证。我们还提出了一种解耦诊断协议,分别报告证据访问(文档 ID 定位)和在全上下文提示下的端到端 QA 质量。这使得对原生长上下文提示和检索管道都能进行一致诊断。在从领域隔离的 64K 上下文到全球共享的 3.26 亿 Token 环境的参考语料梯度上,我们观察到明显的现实差距。在语义干扰下,饱和良性 NIAH 的系统表现会显著下降。这表明语义辨识能力,而非上下文长度本身,是长上下文记忆规模化的主要瓶颈。
关键词
引用
@article{arxiv.2601.20276,
title = {Beyond the Needle's Illusion: Decoupled Evaluation of Evidence Access and Use under Semantic Interference at 326M-Token Scale},
author = {Tianwei Lin and Zuyi Zhou and Xinda Zhao and Chenke Wang and Xiaohong Li and Yu Chen and Chuanrui Hu and Jian Pei and Yafeng Deng},
journal= {arXiv preprint arXiv:2601.20276},
year = {2026}
}