中文

PRELUDE:一个要求对长上下文进行全局理解与推理的基准测试

计算与语言 2025-08-15 v2 人工智能

摘要

我们引入了 PRELUDE,这是一个通过判断角色前传故事是否与原作正典叙事一致来评估长上下文理解的基准测试。与现有基准相比,我们的任务对全局理解和深度推理提出了更高要求——由于前传并非原始故事的一部分,评估其合理性通常需要搜索并整合仅间接相关的信息。经验表明,88% 的实例需要来自叙事多个部分的证据。实验结果凸显了我们任务的挑战性:使用最先进大语言模型的上下文学习、检索增强生成和领域内训练,以及商业深度研究服务,均落后人类超过 15%。进一步的人类研究表明,模型经常产生正确答案但推理有缺陷,导致推理准确性与人类相比存在超过 30% 的差距。这些发现强调了长上下文理解与推理方面仍有巨大的改进空间。

关键词

引用

@article{arxiv.2508.09848,
  title  = {PRELUDE: A Benchmark Designed to Require Global Comprehension and Reasoning over Long Contexts},
  author = {Mo Yu and Tsz Ting Chung and Chulun Zhou and Tong Li and Rui Lu and Jiangnan Li and Liyan Xu and Haoshu Lu and Ning Zhang and Jing Li and Jie Zhou},
  journal= {arXiv preprint arXiv:2508.09848},
  year   = {2025}
}

备注

First 7 authors contributed equally. Project page: https://gorov.github.io/prelude