中文

SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels

计算与语言 2026-01-16 v1 人工智能

摘要

大语言模型(LLM)已展现出显著进步,但理解长且复杂的文档仍然具有挑战性。许多长上下文基准已被提出,但它们面临若干局限,包括任务真实性、数据可扩展性和数据质量。为此,我们引入了 SagaScale,一个基于完整小说构建的真实、可扩展且高质量的长上下文基准。整个基准使用一个自动化数据收集流程构建,该流程利用外部资源(例如,维基百科页面)来整理问答对。至关重要的是,这些外部资源仅用于基准构建,而不在评估期间提供,这使得 LLM 能够整理出超出其在评估期间所能回答范围的复杂问题。SagaScale 也是双语的,并提供了迄今为止最大的上下文长度,英文小说的平均 token 数超过 250K,中文小说超过 320K。我们对 12 个前沿 LLM 和三种长上下文方法——朴素 RAG、智能体 RAG 和长上下文——的评估得出了关键见解,包括:(1)直接向 LLM 提供完整上下文可以大幅优于其他方法;(2)大多数 LLM 在处理长上下文时仍然困难,但 Gemini-2.5-Pro 是一个突出的例外;(3)智能体 RAG 有效解决了朴素 RAG 中的检索瓶颈。最后,我们公开发布 SagaScale 基准和我们的数据收集代码库,以促进未来的研究。

关键词

引用

@article{arxiv.2601.09723,
  title  = {SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels},
  author = {Guancheng Du and Yong Hu and Wenqing Wang and Yaming Yang and Jiaheng Gao},
  journal= {arXiv preprint arXiv:2601.09723},
  year   = {2026}
}