中文

执行链监督促进大型语言模型的通用推理

机器学习 2025-10-29 v1 人工智能 编程语言

摘要

构建稳健且通用推理能力是大型语言模型(LLM)开发的核心目标。近期研究日益依赖代码作为丰富的训练来源,因其内在的逻辑结构和多样化的推理范式(如分治、拓扑排序和枚举)而备受青睐。然而,代码中的推理往往是隐式且与语法或实现噪声交织的,对原始代码进行直接训练并不优化。为此,我们引入 TracePile—a 一个包含 260 万个样本的大型语料库,将代码执行转化为显式、逐步的类链式思考式论证,我们称之为执行链(Chain of Execution, CoE)。该语料库涵盖数学、经典算法和算法竞赛等领域,并通过变量追踪问题和代码重写以提升逻辑细粒度和代码多样性。我们采用三种训练设置对 TracePile 进行评估:继续预训练、预训练后指令调优以及两阶段微调。在四个基础模型(LLaMA 3、LLaMA 3.1、Qwen-2.5 和 Qwen-2.5 Coder)以及覆盖数学、代码、逻辑和算法的 20 个基准测试上,实验结果表明我们的方法 consistently 提升了性能。尤其值得注意的是,在两阶段微调下,TracePile 将 LLaMA3.1-8B 在九个数学数据集上的平均准确率提升了 7.1%,并在 LiveCodeBench、CRUX 和 MMLU 等任务上取得明显进步。

关键词

引用

@article{arxiv.2510.23629,
  title  = {Chain of Execution Supervision Promotes General Reasoning in Large Language Models},
  author = {Nuo Chen and Zehua Li and Keqin Bao and Junyang Lin and Dayiheng Liu},
  journal= {arXiv preprint arXiv:2510.23629},
  year   = {2025}
}