PromptCoT 2.0:规模化大语言模型推理的提示词合成
摘要
大型语言模型(LLMs)正从对话系统演变为强大的推理系统,能够处理奥林匹克数学和竞技编程等任务。虽然扩展参数和测试时计算推动了进展,但一个关键瓶颈是缺乏高质量的训练问题:人工策划的数据集成本高昂且数量有限,而现有的合成语料库往往过于简单或范围狭窄。PromptCoT 1.0 表明,将推理链注入提示词合成可以增加问题难度。在此基础上,我们提出了 PromptCoT 2.0,这是一个可扩展框架,用期望最大化(EM)循环替代了手工设计的启发式方法,通过迭代优化推理链来指导提示词构建。这产生了比先前语料库更具挑战性且更多样化的问题。合成提示词支持两种后训练范式:(1)自博弈,强模型通过可验证反馈自主提升,无需更强的教师模型;以及(2)监督微调(SFT),弱模型从教师蒸馏的轨迹中学习。大量实验验证了该方法的有效性。在自博弈中,将 PromptCoT 2.0 应用于 Qwen3-30B-A3B-Thinking-2507,在 30B 规模上取得了新的最先进结果,在 AIME 24/25 和 HMMT 25 上分别提升 +4.4、+4.8 和 +5.3,在 LiveCodeBench v5/v6 上提升 +6.1 和 +5.0,在 Codeforces 上提升 +35 Elo。在 SFT 中,仅使用合成提示词训练 Qwen2.5-7B-Instruct,将准确率提升至 73.1(AIME 24)、65.6(AIME 25)和 53.4(LiveCodeBench v5),超越了使用人工或混合数据训练的模型。分析进一步证实 PromptCoT 2.0 产生了本质上更具挑战性且分布上截然不同的问题。这些结果确立了提示词合成作为推理扩展的新维度,并将 PromptCoT 2.0 定位为未来开源模型的可扩展基础。实现代码位于 https://github.com/inclusionAI/PromptCoT。
引用
@article{arxiv.2509.19894,
title = {PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning},
author = {Xueliang Zhao and Wei Wu and Jian Guan and Zhuocheng Gong and Lingpeng Kong},
journal= {arXiv preprint arXiv:2509.19894},
year = {2025}
}
备注
Preprint