中文

学习插入[PAUSE]标记以提升推理能力

计算与语言 2025-08-12 v1

摘要

为增强推理能力,先前的研究探索了在训练过程中融入专用标记的策略。这些策略强化了基于Transformer的大语言模型(LLMs)的学习机制。在先前研究的基础上,即在推理步骤之前连续插入虚拟标记可以增强效果,我们提出了一种新方法,称为动态插入标记训练(DIT)。我们的方法根据标记对数似然识别序列中模型置信度最低的位置。在这些位置上策略性地插入[PAUSE]标记,可以增强模型对后续标记的预测能力。在从2.7B模型到8B模型的多样化数据集和模型上的实验结果表明,DIT始终优于传统微调和先前的标记插入方法。通过这种简单而有效的方法,我们在GSM8K上实现了高达4.7%p的准确率提升,在AQUA-RAT上实现了3.23%p的提升,在MBPP数据集上实现了高达3.4%p的pass@1提升。我们的工作展示了一种基于模型的动态方法而非启发式方法,从而拓宽了推理研究的范围。

关键词

引用

@article{arxiv.2506.03616,
  title  = {Learning to Insert [PAUSE] Tokens for Better Reasoning},
  author = {Eunki Kim and Sangryul Kim and James Thorne},
  journal= {arXiv preprint arXiv:2506.03616},
  year   = {2025}
}

备注

18 pages, 5 figures, ACL findings