中文

通过学习多样化思考链模式扩充基础模型的推理潜力

人工智能 2026-02-12 v3 计算与语言

摘要

大型推理模型在具有挑战性的数学推理方面的近期进展得益于强化学习(RL)。在中期训练中融入长链思考(CoT)数据也被证明能显著提升推理深度。然而,当前方法常无差别地利用CoT数据,留下关键问题:哪些数据类型最能有效提升模型推理能力?本文首次定义基础模型的推理潜力作为正确回答问题所需独立尝试次数的倒数,与最终模型性能强相关。我们提出利用富含高价值推理模式的多样化数据来扩充推理潜力。具体而言,我们从CoT序列中抽象出具有常见性和归纳能力的原子推理模式,并构建富含有价值推理模式的核心参考集。进而提出双粒度算法,结合思考链模式和token熵,高效从数据池中筛选与核心集一致的高价值CoT数据(CoTP),从而训练模型有效掌握推理。仅需10B token的CoTP数据即可使85B参数Mixture-of-Experts(MoE)模型在AIME 2024和2025等具有挑战性的测试中提升9.58%,并将下游RL性能上限提升7.81%。

关键词

引用

@article{arxiv.2509.21124,
  title  = {Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns},
  author = {Xuemiao Zhang and Can Ren and Chengying Tu and Rongxiang Weng and Shuo Wang and Hongfei Yan and Jingang Wang and Xunliang Cai},
  journal= {arXiv preprint arXiv:2509.21124},
  year   = {2026}
}