学会推理:使用 GPT-OSS 或 DeepSeek R1 推理轨迹训练大语言模型
计算与语言
2025-11-25 v1
摘要
测试时扩展利用推理过程中的额外计算来提高模型准确性,使一类新的大语言模型(LLM)能够通过理解目标、将目标转化为计划、执行中间步骤并在回答前检查自身工作来解决复杂问题。具有推理能力的前沿大语言模型,如 DeepSeek-R1 和 OpenAI 的 gpt-oss,在解决复杂问题时遵循相同的程序,在给出最终答案之前生成中间推理轨迹。如今,这些模型正被越来越多地用于生成推理轨迹,作为高质量监督数据用于中小型语言模型的后训练,以教授推理能力而无需昂贵的人工策划。在本工作中,我们比较了两种推理轨迹对中等规模 LLM 在数学问题上后训练后的性能。我们从准确率和推理效率两个方面比较了 DeepSeek-R1 和 gpt-oss LLM 生成的推理轨迹的影响。
引用
@article{arxiv.2511.19333,
title = {Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces},
author = {Shaltiel Shmidman and Asher Fredman and Oleg Sudakov and Meriem Bendris},
journal= {arXiv preprint arXiv:2511.19333},
year = {2025}
}