中文

AlphaMath几乎为零:无需过程的过程监督

计算与语言 2024-09-30 v3 人工智能

摘要

尽管大型语言模型(LLMs)的最新进展显著提升了它们在各种任务上的性能,但它们仍然面临复杂和符号化的多步推理挑战,特别是在数学推理中。为了增强LLMs的数学推理能力,现有的大多数工作集中于寻求领域专家或GPT-4的帮助来获取高质量的过程监督数据,这不仅昂贵而且劳动密集。在我们的研究中,我们提出了一个创新框架AlphaMath,通过利用蒙特卡洛树搜索(MCTS)绕过了对过程标注(来自人类或GPT)的需求。该框架专注于释放预训练良好的LLM的潜力,使其自主增强数学推理。具体来说,我们将一个价值模型与LLM集成,在MCTS中自动生成过程监督和步骤级评估信号。此外,我们提出了一种高效的推理策略——步骤级束搜索,其中价值模型被设计为协助策略模型(即LLM)导航更有效的推理路径,而不是仅仅依赖先验概率。在领域内和领域外数据集上的实验结果表明,即使没有GPT-4或人工标注的过程监督,我们的AlphaMath框架也能达到与先前最先进方法相当或更优的结果。

关键词

引用

@article{arxiv.2405.03553,
  title  = {AlphaMath Almost Zero: Process Supervision without Process},
  author = {Guoxin Chen and Minpeng Liao and Chengxi Li and Kai Fan},
  journal= {arXiv preprint arXiv:2405.03553},
  year   = {2024}
}

备注

Camera ready version for NeurIPS 2024