中文

e3: 学习探索使LLM的测试时计算外推成为可能

机器学习 2025-06-16 v2 计算与语言

摘要

测试时扩展为通过利用推理时的更多计算来改善LLM推理提供了一条有前景的路径;然而,这一范式的真正潜力在于外推(即LLM持续"思考"更长时间、超出其训练时的最大token预算时,在困难问题上的性能提升)。令人惊讶的是,我们发现大多数现有的推理模型外推效果不佳。我们证明实现外推的一种方法是训练LLM进行上下文内探索:训练LLM有效地花费其测试时预算,通过链接操作(如生成、验证、精炼等),或在提交答案之前测试多个假设。为了实现上下文内探索,我们确定了e3方案中的三个关键要素:(1)基础LLM具有不对称能力的链接技能,例如将验证(容易)与生成(困难)链接,作为实现上下文内搜索的方式;(2)利用来自错误轨迹的"负"梯度在强化学习中放大探索,产生链接更多不对称性的更长搜索轨迹;(3)通过专门设计的课程将任务难度与训练token预算耦合,以结构化上下文内探索。我们的e3方案在AIME'25和HMMT'25得分上产生了已知的最佳1.7B模型,并外推到训练token预算的2倍。我们的e3-1.7B模型不仅获得了高pass@1分数,而且相对于基础模型改善了pass@k。

关键词

引用

@article{arxiv.2506.09026,
  title  = {e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs},
  author = {Amrith Setlur and Matthew Y. R. Yang and Charlie Snell and Jeremy Greer and Ian Wu and Virginia Smith and Max Simchowitz and Aviral Kumar},
  journal= {arXiv preprint arXiv:2506.09026},
  year   = {2025}
}