中文

SyncThink:一种无需训练的策略,用于对齐推理终止与推理饱和

计算与语言 2026-01-08 v1

摘要

链式思维(Chain-of-Thought, CoT)提示可提升推理能力,但常产生冗长且重复的推理轨迹,从而显著增加推理成本。我们提出SyncThink,一种无需训练、即插即用的解码方法,通过监控模型自身的推理转换信号来终止推理,从而在不修改模型权重的情况下降低CoT开销。我们发现,答案token对早期推理注意力较弱,主要关注特殊token "/think",表明存在信息瓶颈。基于此观察,SyncThink监控模型的推理转换信号并终止推理。在GSM8K、MMLU、GPQA和BBH等数据集上测试三个DeepSeek-R1 distilled模型,SyncThink在656个生成token和28.68秒延迟下实现62.00%的平均Top-1准确率,相较于完整CoT解码的61.22%准确率、2141个token和92.01秒延迟显著提升。在长程任务如GPQA上,SyncThink可进一步提高8.1个绝对百分点的准确率,通过防止过度思考。

关键词

引用

@article{arxiv.2601.03649,
  title  = {SyncThink: A Training-Free Strategy to Align Inference Termination with Reasoning Saturation},
  author = {Gengyang Li and Wang Cai and Yifeng Gao and Yunfang Wu},
  journal= {arXiv preprint arXiv:2601.03649},
  year   = {2026}
}

备注

14 pages, 8 figures