a1:通过环境增强生成实现陡峭的测试时扩展定律
计算与语言
2025-04-22 v1
摘要
大语言模型(LLMs)在推理方面取得了显著突破,但仍在幻觉、逻辑错误以及复杂多步任务中无法自我纠正等方面持续面临挑战。目前的方法如思维链提示提供的推理能力有限,在需要精确步骤验证时会失效。我们提出了环境增强生成(EAG),一个通过以下方式增强 LLM 推理的框架:(1)实时环境反馈验证每个推理步骤,(2)面对错误时动态分支探索以调查替代解路径,以及(3)从成功的推理轨迹中基于经验学习。与现有方法不同,EAG 通过将执行反馈与分支探索紧密结合,实现了有意的回溯和策略性重规划。我们的 a1-32B 模型在所有基准测试中达到了同类规模模型的最先进性能,在竞赛数学上匹敌更大的模型如 o1,同时比可比模型高出最多 24.4 个百分点。分析揭示了 EAG 的独特扩展模式:在环境交互中的初始 token 投入会产生显著的长期性能红利,且优势随任务复杂度成比例放大。EAG 的理论框架展示了环境交互性和系统性分支探索如何共同建立可靠的机器推理新范式,特别是对于需要精确多步计算和逻辑验证的问题。
引用
@article{arxiv.2504.14597,
title = {a1: Steep Test-time Scaling Law via Environment Augmented Generation},
author = {Lingrui Mei and Shenghua Liu and Yiwei Wang and Baolong Bi and Yuyao Ge and Jun Wan and Yurong Wu and Xueqi Cheng},
journal= {arXiv preprint arXiv:2504.14597},
year = {2025}
}