OThink-R1:缓解过度推理的内在快/慢思维模式切换
人工智能
2026-01-07 v3
摘要
人类认知通过两种互补模式运作:快速直觉思维与慢速审慎思维。普通大语言模型(LLM)主要遵循快思维范式,产生即时响应;而近期的大推理模型(LRM)采用慢思维策略,在得出答案前生成详细的推理链。虽然 LRM 通常能实现更高的准确率,但这是以大幅增加 token 使用量为代价的。为解决这一效率与准确率的权衡,我们提出了 OThink-R1,一种将两种模式集成于单一 LRM 中的混合推理框架,并能根据问题特征实现自动模式切换。我们首先识别了 LRM 中必要与冗余推理轨迹的三种主要模式,这些模式指导设计了一个基于 LLM 的辅助评判器,自适应地决定何时需要慢思维。利用评判器的决策,我们通过剪枝冗余推理生成快思维样本并保留完整推理作为慢思维样本,从而构建了一个混合微调数据集。随后使用该数据集微调 LRM,赋予其固有的自主模式选择能力。在数学与问答基准上的广泛实验表明,OThink-R1 在保持具有竞争力的准确率的同时,显著减少了推理 token 的使用。代码可在 https://github.com/AgenticIR-Lab/OThink-R1 获取。
引用
@article{arxiv.2506.02397,
title = {OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation},
author = {Shengjia Zhang and Junjie Wu and Jiawei Chen and Changwang Zhang and Zhe Li and Xingyu Lou and Wangchunshu Zhou and Sheng Zhou and Can Wang and Jun Wang},
journal= {arXiv preprint arXiv:2506.02397},
year = {2026}
}
备注
Under review