中文

Parrot:提升程序 CoT 与自然语言 CoT 的训练管道

计算与语言 2025-10-30 v1

摘要

自然语言链律思维 (N-CoT) 和程序链律思维 (P-CoT) 已成为大语言模型 (LLM) 解决数学推理问题的两种主要范式。当前研究通常致力于单向增强:P-CoT 增强 N-CoT 或 N-CoT 增强 P-CoT。本文旨在充分发挥两种范式的优势进行相互增强,最终实现双向提升。我们对两种范式中的错误类型进行了详细分析,基于此提出了 Parrot:一种用于数学问题的新型训练管道:1)设计三个目标子任务集成顺序的 P-CoT 和 N-CoT 生成;2)子任务混合训练策略促进自然语言语义可迁移性;3)设计转换后的 N-CoT 辅助奖励以缓解 P-CoT 优化中的稀疏奖励问题。大量实验表明,Parrot 显著提升了 N-CoT 和 P-CoT 的性能,尤其在 N-CoT 上。使用 Parrot SFT,LLaMA2 和 CodeLLaMA 在 MathQA 上的 N-CoT 性能分别提升了 +21.87 和 +21.48 个点,相较于 RL 基线效果显著,资源消耗较大。

关键词

引用

@article{arxiv.2510.25310,
  title  = {Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning},
  author = {Senjie Jin and Lu Chen and Zhiheng Xi and Yuhui Wang and Sirui Song and Yuhao Zhou and Xinbo Zhang and Peng Sun and Hong Lu and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2510.25310},
  year   = {2025}
}