ESTAR:面向高效推理的早停 Token 感知推理
人工智能
2026-02-11 v1
摘要
大型推理模型(LRMs)通过生成长链的思考过程(chain-of-thought)实现最先进的性能,但往往在正确答案已被达成后仍浪费计算资源进行冗余推理。我们提出 Early-Stopping for Token-Aware Reasoning(ESTAR),以检测并减少此类推理冗余,从而在不牺牲准确性的前提下提升效率。我们的方法结合了 (i) 一种基于轨迹的分类器,用于识别何时可以安全停止推理;(ii) 监督微调以教导 LRMs 提出自生成的 <stop> 信号;以及 (iii) <stop>-aware 强化学习,在自生成停止点处截断 rollout,并赋予计算感知奖励。四个推理数据集上的实验表明,ESTAR 将推理长度约减少 3.7 倍(从 4,799 降至 1,290),同时保持准确性(74.9% vs. 74.2%),并展现出强劲的跨域泛化能力。这些结果凸显了早停作为提升 LRMs 推理效率的简单而强大机制。
引用
@article{arxiv.2602.10004,
title = {ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference},
author = {Junda Wang and Zhichao Yang and Dongxu Zhang and Sanjit Singh Batra and Robert E. Tillman},
journal= {arXiv preprint arXiv:2602.10004},
year = {2026}
}