中文

你的推理模型是否内隐地知道何时该停止思考?

人工智能 2026-05-19 v5

摘要

大型推理模型(LRMs)的最新进展通过长思维链(CoTs)极大地提升了其在复杂推理任务上的能力。然而,这种方法常常导致大量冗余,损害计算效率,并在实时应用中造成显著延迟。近期研究表明,较长的推理链通常与正确性无关,甚至可能损害准确性。在对这一现象的进一步深入分析中,我们令人惊讶地发现并实证验证了LRMs内隐地知道停止思考的适当时机,而这一能力被当前的采样范式所掩盖。受此启发,我们引入了SAGE(自感知引导的高效推理),一种新颖的采样范式,释放了这种高效推理的潜力。此外,将SAGE作为混合采样集成到基于群体的强化学习(SAGE-RL)中,使得SAGE-RL能够有效地将SAGE发现的高效推理模式融入标准的pass@1推理中,在多个具有挑战性的数学基准上显著提升了LRMs的推理准确性和效率。

关键词

引用

@article{arxiv.2602.08354,
  title  = {Does Your Reasoning Model Implicitly Know When to Stop Thinking?},
  author = {Zixuan Huang and Xin Xia and Yuxi Ren and Jianbin Zheng and Xuanda Wang and Zhixia Zhang and Hongyan Xie and Songshi Liang and Zehao Chen and Xuefeng Xiao and Fuzhen Zhuang and Jianxin Li and Deqing Wang and Yikun Ban},
  journal= {arXiv preprint arXiv:2602.08354},
  year   = {2026}
}