NoLiMa:超越字面匹配的长上下文评估
计算与语言
2025-07-10 v3
摘要
最近的大型语言模型(LLM)支持的长上下文范围从 128K 到 1M token。用于评估这些能力的流行方法是 needle-in-a-haystack(NIAH)测试,即从“haystack”(长无关上下文)中检索“needle”(相关信息)。这种方法的扩展包括增加干扰项、事实链和上下文推理。然而,在这些基准中,模型可以利用 needle 和 haystack 之间的现有字面匹配来简化任务。为此,我们引入 NoLiMa,一个扩展 NIAH 的基准,采用精心设计的 needle 集合,其中问题和 needle 之间的词汇重叠最小,需要模型推断潜在关联以定位 haystack 中的 needle。我们评估了 13 个声称支持至少 128K token 上下文的流行 LLM。虽然它们在短上下文(<1K)中表现良好,但随着上下文长度增加,性能显著下降。例如,在 32K 时,11 个模型的表现会降至其强短长度基准的 50% 以下。即使是表现最好的 GPT-4o,也从几乎完美的 99.3% 基准下降到 69.7%。我们的分析表明,这些下降源于在缺乏字面匹配的情况下,注意力机制在更长的上下文中面临更大的难度,这使得检索相关信息更加困难。即使是增强了推理能力或使用 CoT 提示的模型,也难以在长上下文中保持性能。我们公开发布了数据集和评估代码,地址为 https://github.com/adobe-research/NoLiMa。
引用
@article{arxiv.2502.05167,
title = {NoLiMa: Long-Context Evaluation Beyond Literal Matching},
author = {Ali Modarressi and Hanieh Deilamsalehy and Franck Dernoncourt and Trung Bui and Ryan A. Rossi and Seunghyun Yoon and Hinrich Schütze},
journal= {arXiv preprint arXiv:2502.05167},
year = {2025}
}
备注
Accepted at ICML 2025