中文

基于标记级触发器的无训练中间预算推理

计算与语言 2026-01-13 v1 人工智能 机器学习

摘要

混合推理语言模型通常通过高层次的思考/无思考指令来控制推理行为,但我们发现,这种模式切换主要由少数触发标记驱动,而非指令本身。通过注意力分析和受控提示实验,我们展示领先的“Okay”标记会诱导推理行为,而紧随其后的换行模式会抑制其推理。基于此观察,我们提出Mid-Think,一种简单无训练的提示格式,组合这些触发器以实现中间预算推理,在准确率与长度权衡方面 consistently 优于固定标记和基于提示的基线。此外,将Mid-Think应用于SFT后的RL训练可将训练时间缩短约15%,同时将Qwen3-8B在AIME上的最终性能从69.8%提升至72.4%,在GPQA上从58.5%提升至61.1%,展示了其对推理训练和推理时间控制的有效性。

关键词

引用

@article{arxiv.2601.07036,
  title  = {Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers},
  author = {Wang Yang and Debargha Ganguly and Xinpeng Li and Chaoda Song and Shouren Wang and Vikash Singh and Vipin Chaudhary and Xiaotian Han},
  journal= {arXiv preprint arXiv:2601.07036},
  year   = {2026}
}