中文

NPG-Muse: 利用 NP-Hard 图问题扩展长思维链推理

计算与语言 2026-02-18 v2 人工智能 机器学习

摘要

推理大语言模型(RLLM)近期在复杂推理任务上取得了显著进展,这主要得益于其长思维链(Long CoT)能力。然而,开发这些 Long CoT 行为严重依赖于高质量数据集的后训练,此类数据集通常成本高昂且依赖人工构建(例如数学和代码),导致可扩展的替代方案尚未被探索。在本研究中,我们引入 NP-Hard(NPH)图问题作为一种新颖的合成训练语料库,因为它们本质上需要深度推理、广泛探索和反思策略,这些正是 Long CoT 推理的核心特征。基于这一洞察,我们开发了一个两阶段后训练框架:在拒绝采样的 NPH 图实例上进行 Long CoT 监督微调(SFT),以显著增强推理深度;以及采用细粒度奖励设计的强化学习(RL),以提升推理效率。由此产生的 NPG-Muse 系列模型展现出大幅增强的 Long CoT 推理能力,在数学、编码、逻辑和图推理基准测试中取得了一致的提升。NPG-Muse-7B 甚至在准确率和推理效率上,于 NPH 图问题中超越了 QwQ-32B。这些结果确立了 NPH 图问题作为推进 LLM 后训练中 Long CoT 推理的有效且可扩展资源。我们的实现可在 https://github.com/littlewyy/NPG-Muse 获取。

关键词

引用

@article{arxiv.2508.20373,
  title  = {NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems},
  author = {Yuyao Wang and Bowen Liu and Jianheng Tang and Nuo Chen and Yuhan Li and Qifan Zhang and Chenyi Zi and Chen Zhang and Jia Li},
  journal= {arXiv preprint arXiv:2508.20373},
  year   = {2026}
}