中文

CoT-Evo:面向科学推理的思维链进化蒸馏

计算与语言 2025-10-17 v2

摘要

虽然从先进的大型语言模型(LLM)中蒸馏思维链(CoT)在通用推理任务中已被证明有效,但在科学领域,由于高度复杂性和专业知识要求,即使先进模型也常常产生错误或肤浅的推理,因此该方法面临挑战。直接从此类有缺陷的输出中进行蒸馏会导致训练数据质量低下,并限制较小学生模型的性能。为克服此问题,我们提出CoT-Evo,一个进化式CoT蒸馏框架。它首先从多个LLM思考者构建一个多样化的推理轨迹池,用自动检索的领域知识丰富它们,然后通过新颖性驱动的选择、反思性重组和变异来迭代优化轨迹。优化过程由一个评估答案正确性、连贯性和有效知识利用的适应度函数引导。这产生了一个为科学推理量身定制的高质量CoT数据集。我们使用这个进化后的数据集微调一个紧凑模型,该模型在科学推理基准测试上取得了最先进的性能。我们的工作建立了一种从多样且易出错的LLM中合成高保真科学推理数据的可扩展方法。

关键词

引用

@article{arxiv.2510.13166,
  title  = {CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning},
  author = {Kehua Feng and Keyan Ding and Zhihui Zhu and Lei Liang and Qiang Zhang and Huajun Chen},
  journal= {arXiv preprint arXiv:2510.13166},
  year   = {2025}
}

备注

28 pages, 3 figures