中文

耦合税:在固定输出限制下,共享 Token 预算如何削弱可见链式思考

机器学习 2026-05-11 v1

摘要

链式思考常被视为通过让模型思考更久来提高语言模型准确率的单调方法。我们识别出一种反向作用,即耦合税:当推理痕迹和最终答案共享一个输出 token 预算时,较长的推理痕迹会挤占它们本要支持的答案。我们在 GSM8K、MATH-500 和五个 BIG-Bench Hard 任务中使用 Qwen3 模型的三个规模进行测试,发现非思考模式在 GSM8K 和 MATH-500 的每个预算(最高达 2048 token)下,都与或超过思考模式。对于更难的任务,交叉点转移到更大的预算。我们推导出一种截断浪费分解公式:Accthink(b)=αcFL(b)+αt(1FL(b))\mathrm{Acc}_{\mathrm{think}}(b)=\alpha_c F_L(b)+\alpha_t(1-F_L(b)),该公式从链长和准确率统计数据预测了这种交叉点,并解释了 Qwen 系列模型中的逆比例效应。DeepSeek-R1-Distill-Llama-8B 的复制实验显示,在不同的思考界面下也出现了相同的模式。作为缓解措施,split-budget 生成将推理和答案的预算分离;在完整的 MATH-500 上,IRIS 达到 74.0% 的准确率,强化提取变体达到 78.8%,而固定非 oracle SC+IRIS 门控达到 83.6%。本结果表明,测试时推理应被视为一种预算分配问题,而不仅仅是是否可用更长的推理痕迹。

关键词

引用

@article{arxiv.2605.07686,
  title  = {The Coupling Tax: How Shared Token Budgets Undermine Visible Chain-of-Thought Under Fixed Output Limits},
  author = {Wenhua Nie and Junlin Liu and Jianan Wu and Zijie Meng and Yilong Fan and Zhang Zijian and Haoran Zheng and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2605.07686},
  year   = {2026}
}

备注

40 pages, 6 figures