中文

分步标记:通过步骤监控控制语言推理模型的生成

计算与语言 2025-12-17 v1 人工智能

摘要

过去几年里,语言推理模型(LRMs)的研究活跃度不断提升,训练与推理技术的进步使得模型能够进行更长且更精确的推理。然而,广泛的研究表明,LRMs 仍然效率不高,过度生成验证和反思步骤。为此,我们引入了 Step-Tagging 框架,这是一种轻量级句子分类器,能够实时标注 LRM 正在生成的推理步骤类型。为监控推理行为,我们提出了 ReasonType:一种新颖的推理步骤分类学。基于此框架,我们证明了对特定步骤计数进行在线监控可产生有效且可解释的 LRM 推理早停准则。我们在三个开源推理模型上评估了 Step-Tagging 框架,适用于标准基准数据集:MATH500、GSM8K、AIME 以及非数学任务(GPQA 和 MMLU-Pro)。在保持与标准生成相当准确性的前提下,我们实现了 20% 到 50% 的 token 减少,计算密集型任务获得的最大收益最为显著。这项工作提供了一种新颖的方式,增加了对 LRM 生成过程的控制力度,并为研究 LRM 行为提供了新工具。

关键词

引用

@article{arxiv.2512.14332,
  title  = {Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring},
  author = {Yannis Belkhiter and Seshu Tirupathi and Giulio Zizzo and John D. Kelleher},
  journal= {arXiv preprint arXiv:2512.14332},
  year   = {2025}
}