LongReasonArena:面向大语言模型的长推理基准
计算与语言
2025-08-28 v1 人工智能
摘要
现有的大语言模型(LLMs)长上下文基准侧重于评估对长输入的理解,而忽略了对长推理能力的评估。为弥补这一空白,我们引入了 LongReasonArena,一个专门设计用于评估 LLMs 长推理能力的基准。我们的任务要求模型通过执行多步算法来解决问题,这些算法反映了长推理的关键方面,如检索和回溯。通过控制输入,所需的推理长度可以任意扩展,对于最具挑战性的任务,推理长度可达 100 万 token。广泛的评估结果表明,LongReasonArena 对开源和闭源 LLMs 都构成了重大挑战。例如,Deepseek-R1 在我们的任务上仅达到 7.5% 的准确率。进一步分析还揭示,准确率相对于预期推理步数的对数呈线性下降。我们的代码和数据可在 https://github.com/LongReasonArena/LongReasonArena 获取。
引用
@article{arxiv.2508.19363,
title = {LongReasonArena: A Long Reasoning Benchmark for Large Language Models},
author = {Jiayu Ding and Shuming Ma and Lei Cui and Nanning Zheng and Furu Wei},
journal= {arXiv preprint arXiv:2508.19363},
year = {2025}
}