NeedleChain:衡量大语言模型完整上下文理解能力
计算与语言
2026-01-05 v2 人工智能
摘要
近期报告表明,大语言模型(LLM)能够处理日益增长的上下文。然而,许多现有上下文理解基准测试嵌入了大量与查询无关的内容,这会使评估偏向于检索相关片段而非充分整合所有提供的信息。在此设置下,当前基准测试可能高估LLM的真实上下文理解能力。我们指出,即使上下文完全由查询相关文本组成,尼格塔-4o等先进模型也难可靠地整合最短200个标记的信息。为更严格地评估此能力,我们引入NeedleChain,一种测试模型是否忠实地整合所有给定证据的基准测试。NeedleChain包含三种变体,区别在于所需的理解顺序,并附带基于needle-in-a-haystack(NIAH)范式的平行基准测试。通过比较这些变体,NeedleChain实现了更全面的上下文理解评估。我们进一步提出一种训练自由策略,鼓励模型反映所有可用信息,即ROPE收缩,凸显了完全集成上下文的重要性,并指向了改进可靠上下文推理的新方向。
引用
@article{arxiv.2507.22411,
title = {NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models},
author = {Hyeonseok Moon and Heuiseok Lim},
journal= {arXiv preprint arXiv:2507.22411},
year = {2026}
}
备注
13 pages