中文

Oolong:评估长上下文推理与聚合能力

计算与语言 2025-11-05 v1 人工智能

摘要

随着模型上下文长度的持续增长,关于模型是否能有效利用完整上下文长度的担忧一直存在。尽管近期发布了一些精心设计的长上下文评估,但这些评估往往依赖于从一个或多个上下文片段中进行检索,这使得几乎所有的上下文标记都可以被视为噪声而被忽略。这仅代表了长上下文可能执行的任务类型之一。我们引入了 Oolong,这是一个长上下文推理任务的基准测试,要求对文本的各个片段进行原子级别的分析,然后将这些分析聚合起来以回答分布性问题。Oolong 分为两个任务集:Oolong-synth,一组自然主义的合成任务,我们可以轻松地消融推理问题的组成部分;以及 Oolong-real,一个下游设置,需要对真实世界的对话数据进行推理。Oolong 要求模型对大量示例进行推理,在上下文中执行分类和计数,并对时间和用户关系进行推理。即使是前沿模型在 Oolong 上也表现挣扎,GPT-5、Claude-Sonnet-4 和 Gemini-2.5-Pro 在 128K 长度的两个子集上准确率均低于 50%。我们发布了 Oolong 的数据和评估工具,以促进能够对大量文本进行推理的模型的进一步发展。

关键词

引用

@article{arxiv.2511.02817,
  title  = {Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities},
  author = {Amanda Bertsch and Adithya Pratapa and Teruko Mitamura and Graham Neubig and Matthew R. Gormley},
  journal= {arXiv preprint arXiv:2511.02817},
  year   = {2025}
}

备注

Preprint