CoreThink:基于 LLM 推理长程任务的符号推理层
人工智能
2025-09-04 v2
摘要
我们介绍了 CoreThink,这是一个建立于一种名为 General Symbolics 的新颖推理方法之上的 SOTA 推理层。这种方法不同于测试时扩展、监督微调(SFT)和带可验证奖励的强化学习(RLVR)等推理范式。CoreThink 的通用符号推理器(GSR)专门围绕三个关键用例构建:工具调用、代码生成和规划,在各自领域的总共七个基准测试中展示了 exemplary 的性能。值得注意的是,我们在 Livecodebench v6 上达到了 66.66% 的 SOTA 分数,在 Instruction-Following Evals 上达到了 89%,在 ARC-AGI-2 上达到了 24.4%。我们还提出了一个使用 General Symbolics 原理开发的智能体编程 IDE,它在 SWE-Bench Lite 上达到了 62.3% 的 SOTA 准确率。我们能够在没有任何微调或训练成本的情况下实现这些改进。我们的推理层旨在提供纯粹的性能提升,确保模型在推理任务上的准确性永远不会受到负面影响。我们认为,现有方法最终将导致 LLM 性能的边际收益递减,因此需要开发新的推理技术。本技术报告在高层次上详细介绍了我们的方法以及 CoreThink 模型在推理密集型用例中的可用性。
引用
@article{arxiv.2509.00971,
title = {CoreThink: A Symbolic Reasoning Layer to reason over Long Horizon Tasks with LLMs},
author = {Jay Vaghasiya and Omkar Ghugarkar and Vishvesh Bhat and Vipul Dholaria and Julian McAuley},
journal= {arXiv preprint arXiv:2509.00971},
year = {2025}
}