中文

通过口头批评改善大语言模型推理中的推理过程监督

计算与语言 2026-04-24 v1 人工智能

摘要

推理时间扩展的 LLM 推理已聚焦于三个维度:链深度、抽样宽度和已学习的步骤评分器(PRMs)。我们引入第四个维度,通过口头过程监督(VPS)实现对外部口头监督粒度的控制,这是一种无需训练的框架,使用来自更强监督者的结构化自然语言批评,指导迭代的生成-批评-精炼循环,最多进行 R 轮。在 GPQA Diamond、AIME 2025 和 LiveCodeBench V6(覆盖封闭式和开放式模型)上,VPS 取得了三个关键结果:第一,在 GPQA Diamond 上,GPT-5.4(High)| GPT-5.4(Low)在 R=4 时达到 94.9%,超越了 94.1% 的无梯度更新的现有最佳成绩。第二,在 AIME 2025 上,VPS 实现了强弱演员的救援,将分数从 11.7-26.7% 提升至 63.3-90.0%(最高提升 63.3 分)。第三,在相同计算资源下,VPS 对 Reflexion 高出 +8.5 到 +12.1 分,对 Self-Consistency@5 高出 +5.0 百分点(GPQA)和 +8.3 百分点(LiveCodeBench),从而隔离了批评粒度作为关键驱动因素。性能随监督者-演员能力差距而提升(Pearson r=0.90),当错误无法用语言表达时(如代码合成)性能下降,激发了混合口头-可执行方法的动力。这些结果确立了批评粒度作为推理时间扩展的新维度。

关键词

引用

@article{arxiv.2604.21611,
  title  = {Process Supervision via Verbal Critique Improves Reasoning in Large Language Models},
  author = {Hao-Yuan Chen},
  journal= {arXiv preprint arXiv:2604.21611},
  year   = {2026}
}