中文

面向测试时间计算扩展的自适应校正抽样

高能物理 - 理论 2025-04-03 v1

摘要

OpenAI-o1和DeepSeek-R1的最新发布表明,测试时间计算可显著提升模型性能,尤其是在复杂任务如逻辑推理方面。常见的测试时间计算方法涉及生成更多思维链(CoT)或带自我纠正的更长CoT。然而,尽管自我纠正可提升性能,但若推理步骤已正确,可能导致大量token浪费并降低CoT的可读性。为证明大型语言模型(LLM)可在更细粒度层面上进行错误校正,我们提出了自适应校正抽样(AR-Sampling),该方法可引导模型在恰当步骤进行自我纠正。AR-Sampling利用过程监督奖励模型(PRM)作为验证器,并构建触发句子以引导模型进行自适应步骤级的再思考。通过在GSM8K和MATH500上的实验,结果表明,我们的方法使模型能够在更细粒度层面进行再思考,从而提高解决方案的准确率,同时生成合理数量的额外token。

关键词

引用

@article{arxiv.2504.01316,
  title  = {Metrics over multi-parameter AdS vacua},
  author = {Eran Palti and Nicolò Petri},
  journal= {arXiv preprint arXiv:2504.01316},
  year   = {2025}
}

备注

46 pages