中文

AdaptThink:推理模型可以学会何时思考

计算与语言 2025-05-20 v1 人工智能 机器学习

摘要

最近,大型推理模型通过采用类似人类深度思考,在各种任务上取得了令人瞩目的表现。然而,冗长的思考过程大幅增加了推理开销,使效率成为关键瓶颈。在本工作中,我们首先证明 NoThinking——提示推理模型跳过思考并直接生成最终解——对于相对简单的任务而言,在性能与效率上都是更好的选择。受此启发,我们提出 AdaptThink,一种新颖的强化学习算法,用于教导推理模型根据问题难度自适应地选择最优思考模式。具体而言,AdaptThink 具有两个核心组件:(1)一个约束优化目标,鼓励模型选择 NoThinking 同时保持整体性能;(2)一种重要性采样策略,在在线训练期间平衡 Thinking 和 NoThinking 样本,从而实现冷启动,并允许模型在整个训练过程中探索和利用两种思考模式。我们的实验表明,AdaptThink 显著降低了推理成本,同时进一步提升了性能。值得注意的是,在三个数学数据集上,AdaptThink 将 DeepSeek-R1-Distill-Qwen-1.5B 的平均响应长度减少了 53%,将其准确率提高了 2.4%,展示了自适应思考模式选择在优化推理质量与效率之间平衡的前景。我们的代码和模型可在 https://github.com/THU-KEG/AdaptThink 获取。

关键词

引用

@article{arxiv.2505.13417,
  title  = {AdaptThink: Reasoning Models Can Learn When to Think},
  author = {Jiajie Zhang and Nianyi Lin and Lei Hou and Ling Feng and Juanzi Li},
  journal= {arXiv preprint arXiv:2505.13417},
  year   = {2025}
}