Sequential-NIAH:抽取长上下文中顺序信息的针砣之山基准
计算与语言
2025-09-23 v3 信息检索
摘要
评估大型语言模型 (LLM) 处理长上下文的能力尤为关键,尤其是检索其中嵌入的查询相关信息。我们引入 Sequential-NIAH,一个专为评估 LLM 从长上下文中提取顺序信息项(即 needle)能力而设计的基准。该基准包含三种 needle 生成管道:synthetic-temporal、real-temporal 和 real-logical 顺序,上下文长度为 8K 至 128K,总计 14,000 样本(测试集 2,000)。为促进基准评估,我们训练了一个评估模型,通过比较 LLM 回答的完整性和顺序一致性来评估其正确性,该模型比 GPT-4 或 Claude 更可靠。我们在六个知名 LLM 上进行实验,发现即便是表现最佳的模型在本基准测试集上最高准确率仅为 63.50%。进一步分析表明,随着上下文长度或 needle 数量的增加,带来的挑战日益严峻,凸显了 LLM 仍有广阔提升空间。此外,噪声分析验证了基准的可靠性与挑战性,使 Sequential-NIAH 成为推动 LLM 长文本信息抽取能力研究的重要参考。
引用
@article{arxiv.2504.04713,
title = {Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts},
author = {Yifei Yu and Qian-Wen Zhang and Lingfeng Qiao and Di Yin and Fang Li and Jie Wang and Zengxi Chen and Suncong Zheng and Xiaolong Liang and Xing Sun},
journal= {arXiv preprint arXiv:2504.04713},
year = {2025}
}