中文

先天推理还不够:In-Context Learning 提升了带有少量过度思考的推理大型语言模型

人工智能 2025-03-26 v1

摘要

近期大型语言模型(LLM)的进展引入了推理大型语言模型(RLLM),它们采用延长的思考过程,包括反思和自我纠正的能力,展示了测试时间扩展的有效性。RLLM 具备源自训练的先天链式思考(CoT)推理能力,自然引出一个问题:在 RLLM 中,是否需要流行的 In-Context Learning(ICL)方法(如 CoT 提示)来增强其推理能力?本文提供了对 Zero-shot CoT 和 Few-shot CoT 对 RLLM 在数学推理任务中影响的首次全面分析。我们考察了参数从 1.5B 到 32B 的模型,发现与担忧相反,CoT 提示在大多数情景下显著提升了 RLLM 的性能。我们的结果揭示了 distinct 模式:大容量模型在简单任务上几乎不受益,但在复杂问题上获得显著提升,而小模型则表现相反。进一步的分析表明,CoT 提示有效地控制了思考标记数和推理步骤的分布,在某些情况下将过度反思减少约 90%。此外,注意力 logits 分析揭示了 RLLM 对反思相关词汇的过拟合,这通过外部 CoT 指导得到缓解。值得注意的是,我们的实验表明,对于 RLLM,一种 CoT 方法始终优于 Few-shot CoT 方法。我们的发现为通过适当的提示策略优化 RLLM 性能提供了重要见解。

关键词

引用

@article{arxiv.2503.19602,
  title  = {Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking},
  author = {Yuyao Ge and Shenghua Liu and Yiwei Wang and Lingrui Mei and Lizhe Chen and Baolong Bi and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2503.19602},
  year   = {2025}
}