中文

LongReasonArena:面向大语言模型的长推理基准

计算与语言 2025-08-28 v1 人工智能

摘要

现有的大语言模型(LLMs)长上下文基准侧重于评估对长输入的理解,而忽略了对长推理能力的评估。为弥补这一空白,我们引入了 LongReasonArena,一个专门设计用于评估 LLMs 长推理能力的基准。我们的任务要求模型通过执行多步算法来解决问题,这些算法反映了长推理的关键方面,如检索和回溯。通过控制输入,所需的推理长度可以任意扩展,对于最具挑战性的任务,推理长度可达 100 万 token。广泛的评估结果表明,LongReasonArena 对开源和闭源 LLMs 都构成了重大挑战。例如,Deepseek-R1 在我们的任务上仅达到 7.5% 的准确率。进一步分析还揭示,准确率相对于预期推理步数的对数呈线性下降。我们的代码和数据可在 https://github.com/LongReasonArena/LongReasonArena 获取。

关键词

引用

@article{arxiv.2508.19363,
  title  = {LongReasonArena: A Long Reasoning Benchmark for Large Language Models},
  author = {Jiayu Ding and Shuming Ma and Lei Cui and Nanning Zheng and Furu Wei},
  journal= {arXiv preprint arXiv:2508.19363},
  year   = {2025}
}