中文

NaturalThoughts:为通用推理任务选择并提炼推理痕迹

计算与语言 2025-07-03 v1

摘要

最近的工作表明,通过监督微调从较大教师模型 distilled 推理痕迹能优于仅使用较小学生模型的强化学习方法(Guo 等人 2025)。然而,尚无系统性研究探讨哪些类型的推理演示最能提高学生模型的推理能力。本文我们通过从 NaturalReasoning(Yuan 等人 2025)中大量问题的强教师模型中挑选推理痕迹,构建高质量的 NaturalThoughts。我们首先系统性分析了影响 distilled 推理能力的因素,包括一般推理任务中的样本效率和可扩展性。我们观察到,仅通过随机采样扩大数据规模是强大的基线,能够稳定地获得性能提升。进一步地,我们发现选择需要更多样化推理策略的困难示例更能有效地传递教师模型的推理技能。在 Llama 和 Qwen 模型上,使用 NaturalThoughts 的训练在包括 GPQA-Diamond、MMLU-Pro 和 SuperGPQA 在内的通用 STEM 推理基准测试中优于现有的推理数据集,如 OpenThoughts、LIMO 等。

关键词

引用

@article{arxiv.2507.01921,
  title  = {NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks},
  author = {Yang Li and Youssef Emad and Karthik Padthe and Jack Lanchantin and Weizhe Yuan and Thao Nguyen and Jason Weston and Shang-Wen Li and Dong Wang and Ilia Kulikov and Xian Li},
  journal= {arXiv preprint arXiv:2507.01921},
  year   = {2025}
}