中文

利用推理模型答案提升非推理模型能力

计算与语言 2025-04-15 v1

摘要

最近的大型语言模型 (LLM) 发展,如 DeepSeek-R1 和 OpenAI-o1,显示出通过 test-time scaling 获得显著性能提升的显著效果,这些在 various benchmarks 上取得了 substantial 的性能提升。这些先进模型利用 deliberate "思考" 步骤系统性地提高答案质量。本文提出了利用推理密集型模型生成的 high-quality 输出来改进计算需求较低的 non-reasoning 模型的想法。我们探索并比较了利用推理模型生成的答案来训练和改进 non-reasoning 模型的方法。通过在 established benchmarks 上进行 straightforward 的监督微调 (SFT) 实验,我们展示了在 various benchmarks 上 consistent 的改进,凸显了这一方法在推进模型直接回答问题能力方面的潜力。

关键词

引用

@article{arxiv.2504.09639,
  title  = {Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability},
  author = {Haotian Wang and Han Zhao and Shuaiting Chen and Xiaoyu Tian and Sitong Zhao and Yunjie Ji and Yiping Peng and Xiangang Li},
  journal= {arXiv preprint arXiv:2504.09639},
  year   = {2025}
}