学习一种持续思考标记以提升测试时扩展性能
计算与语言
2026-05-14 v2 机器学习
摘要
测试时扩展(test-time scaling)已成为通过在推理阶段利用额外计算资源来提高语言模型性能的有效方法。最近的研究表明,覆盖结束思考标记(例如,将“”替换为“Wait”)可以延长推理步骤并提升准确率。本文探讨了是否存在一种专门的持续思考标记(continue-thinking token)可被学习以触发扩展推理。我们对DeepSeek-R1的蒸馏版本进行了增强,加入单个学习型的"<|continue-thinking|>"标记,仅通过强化学习训练其嵌入向量,而保持模型权重不变。我们的实验表明,这种学习型标记在标准数学基准测试中的准确率优于基线模型以及使用固定标记(例如"Wait")进行预算强制的测试时扩展方法。特别地,我们观察到,在固定标记方法提升基线模型准确率的案例中,我们的方法实现了显著更大的改进。例如,在GSM8K基准测试中,固定标记方法仅提供1.3%的绝对准确率提升,而我们的学习型标记方法相对于不使用预算强制的基线模型实现了4.2%的提升。
引用
@article{arxiv.2506.11274,
title = {Learning a Continue-Thinking Token for Enhanced Test-Time Scaling},
author = {Liran Ringel and Elad Tolochinsky and Yaniv Romano},
journal= {arXiv preprint arXiv:2506.11274},
year = {2026}
}