R-Horizon:你的大型推理模型在宽度和深度上还能走得多远?
人工智能
2025-10-22 v2 计算与语言
摘要
最近的趋势通过长链式思维(Chain-of-Thought, CoT)实现了对推理模型(如 OpenAI o1、DeepSeek-R1)的测试时扩展,带来了显著的性能提升。然而,现有基准主要关注即时、单向 horizons 任务,未能充分评估大型推理模型(LRM)应对复杂、长 horizons 场景的能力。为此,我们提出 R-HORIZON,通过查询组合激发 LRM 的长 horizons 推理行为。基于 R-HORIZON,我们构建了一个长 horizons 推理基准,包含跨越长 horizons 的相互依赖的复杂多步骤推理任务。通过使用 R-HORIZON 基准对 LRM 进行全面评估,我们发现即便是最先进的 LRM 也在性能上出现显著下降。我们的分析揭示了 LRM 在有效推理长度方面存在局限,以及在跨多个问题合理分配思考预算方面的困难。鉴于这些局限性,我们利用 R-HORIZON 构建了用于强化学习 with verified rewards(RLVR)的长 horizons 推理数据。与使用单 horizons 数据训练相比,RLVR with R-HORIZON 不仅在多 horizons 推理任务上显著提升性能,而且在标准推理任务上的准确率也提升了 7.5 分(AIME2024)。这些结果将 R-HORIZON 定位为一种可扩展、可控且成本低廉的范式,用于提升和评估 LRM 的长 horizons 推理能力。
关键词
引用
@article{arxiv.2510.08189,
title = {R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?},
author = {Yi Lu and Jianing Wang and Linsen Guo and Wei He and Hongyin Tang and Tao Gui and Xuanjing Huang and Xuezhi Cao and Wei Wang and Xunliang Cai},
journal= {arXiv preprint arXiv:2510.08189},
year = {2025}
}