100 万 Token 上下文窗口中的检索与多跳推理:在古文文本上评估大语言模型
人工智能
2026-05-05 v1
摘要
我们在古文语料库上评估五个宣称拥有 100 万 Token 上下文窗口的前沿大语言模型的长程检索与推理能力。报告两项互补研究。测试 1 测量在 100 万 Token 输入中进行单 needle 检索,植入三个不同深度的生物信息 needle,并配对真实(训练先前一致)和改编(训练先前矛盾)变体,以分离真正的情境检索与依赖已记忆训练数据的能力。测试 2 是随后的后续设计,旨在探讨当检索需要中间推理时,长程能力是否退化,测量跨三个上下文层级(256K、512K 和 1M Token)的三跳链遍历。我们发现,100 万 Token 上的单 needle 检索对最强模型已基本解决——Gemini 3.1 Pro、Claude Opus 4.7 和 GPT-5.5 均实现 100%,但多跳性能揭示了三种不同的退化特征:稳定型(Gemini Pro、Claude)在 512K 时保持 >80% 准确率,1M 时仅有适度退化;晚期崩塌型(GPT-5.5、Qwen3.6-plus)在 512K 到 1M 之间出现尖锐崩塌;平滑衰减型(DeepSeek V4 Pro)在整个范围内逐渐衰减。这些发现表明,名义上的上下文窗口长度是可用长程多跳能力的糟糕代理,而 512K 到 1M 的转折是当前 100 万上下文旗舰模型之间最尖锐的区分器。
引用
@article{arxiv.2605.02173,
title = {Retrieval and Multi-Hop Reasoning in 1M-Token Context Windows: Evaluating LLMs on Classical Chinese Text},
author = {Eric H. C. Chow},
journal= {arXiv preprint arXiv:2605.02173},
year = {2026}
}