中文

后置推理:零成本提升非思考模型性能

人工智能 2026-05-08 v1

摘要

随着大语言模型(LLM)的广泛采用加速,来自中间推理轨迹的 token 消耗日益增加推理延迟和运营成本。近期研究表明,许多现实世界任务几乎不需要显式推理,额外的推理有时甚至会降低性能。在本工作中,我们提出了 \textbf{Post-Reasoning},一种简单而有效的方法,通过条件化模型在生成最终回复后论证其答案来改进指令微调模型。在设计上,它使得最终答案能够在无额外延迟或 token 成本的情况下获得,同时仍通过简单的指令增强提升性能。我们在跨越 13 个开源和专有模型、4 个模型家族和 9 个多样化推理与知识密集型基准(包括 AMC、HMMT、GSM8K、GPQA、MMLU-Pro 和 BIG-Bench Hard)的 117 个模型-基准设置上评估了 Post-Reasoning。Post-Reasoning 在超过 88.19% 的评估设置中提升了性能,实现了 17.37% 的平均相对提升。此外,我们提出了监督后置推理微调,在超过 91.11% 的评估设置中进一步提升了性能,并比基于提示的后置推理基线平均超出 8.01%,证明了后置推理可以通过训练被有效内化。最终,Post-Reasoning 为直接回答能力确立了新的性能上限。

关键词

引用

@article{arxiv.2605.06165,
  title  = {Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost},
  author = {Richmond Sin Jing Xuan and Rishabh Bhardwaj and Soujanya Poria},
  journal= {arXiv preprint arXiv:2605.06165},
  year   = {2026}
}