中文

LongCoT:长期链式思维推理基准

机器学习 2026-04-16 v1 人工智能

摘要

随着语言模型越来越多地被用于复杂的自主任务,其在更长时间范围内进行准确推理的能力变得至关重要。这种能力的一个关键组成部分是规划和管理长而复杂的链式思维(chain-of-thought, CoT)。我们引入LongCoT,一个规模可扩展的基准,包含2500个专家设计的题目,涵盖化学、数学、计算机科学、象棋和逻辑,旨在隔离并直接测量前沿模型的长期CoT推理能力。题目由简短输入组成,需通过验证答案;解决它们需要遍历相互依赖的步骤,这些步骤跨越数十万甚至数十万的推理标记。每个局部步骤对前沿模型都是可行的,因此失败反映的是长期推理限制。在发布时,最佳模型在LongCoT上的准确率不足10%(GPT 5.2:9.8%;Gemini 3 Pro:6.1%),揭示了当前能力之间的显著差距。总体而言,LongCoT提供了对长期推理的严格衡量,追踪前沿模型在延长时间段内可靠推理的能力。

关键词

引用

@article{arxiv.2604.14140,
  title  = {LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning},
  author = {Sumeet Ramesh Motwani and Daniel Nichols and Charles London and Peggy Li and Fabio Pizzati and Acer Blake and Hasan Hammoud and Tavish McDonald and Akshat Naik and Alesia Ivanova and Vignesh Baskaran and Ivan Laptev and Ruben Glatt and Tal Ben-Nun and Philip Torr and Natasha Jaques and Ameya Prabhu and Brian Bartoldson and Bhavya Kailkhura and Christian Schroeder de Witt},
  journal= {arXiv preprint arXiv:2604.14140},
  year   = {2026}
}

备注

Long-Horizon Reasoning Benchmark