CoTEvol:用于数学推理数据合成的自进化思维链
人工智能
2026-04-17 v1
摘要
大型语言模型(LLMs)在以阐明中间步骤的高质量思维链(CoT)进行训练时,展现出强大的数学推理能力,然而高昂的 CoT 策展成本阻碍了进一步的进展。尽管现有的补救措施(如从更强的 LLMs 中进行蒸馏以及基于测试时搜索的自合成)缓解了这一问题,但它们通常面临收益递减或高计算开销的问题。在本文中,我们提出了 CoTEvol,这是一个遗传进化框架,将 CoT 生成转化为对推理轨迹的种群搜索。候选轨迹通过轨迹层面的反思性全局交叉和步骤层面由不确定性引导的局部变异进行迭代进化,实现了整体重组与细粒度优化。我们设计了轻量级、任务感知的适应度函数,以引导进化过程趋向准确且多样的推理。在实验中,CoTEvol 将正确 CoT 合成的成功率提高了 30% 以上,并增强了结构多样性,同时显著提升了效率。在这些进化 CoT 数据上训练的 LLMs 在八个数学基准测试中平均提升了 6.6%,优于以往的蒸馏和自合成方法。这些结果突显了进化式 CoT 合成作为数学推理任务中一种可扩展且有效方法的前景。
引用
@article{arxiv.2604.14768,
title = {CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning},
author = {Zhuo Wang and Zhuo Zhang and Yafu Li and Yu Cheng and Lizhen Qu and Zenglin Xu},
journal= {arXiv preprint arXiv:2604.14768},
year = {2026}
}
备注
acl2026 findings