中文

基于过程奖励引导的树状搜索中的大语言模型集成以提升复杂推理能力

计算与语言 2024-12-23 v1

摘要

尽管近期在大语言模型方面取得了进展,但开源模型常常在复杂推理任务上难以稳健地取得好成绩。现有的集成方法无论是在标记级别还是输出级别,都未能解决这些挑战。为此,我们提出了一种名为 Language model Ensemble with Monte Carlo Tree Search (LE-MCTS) 的新型框架,用于语言模型的过程级集成。LE-MCTS 将逐步推理建模为马尔可夫决策过程。在该框架中,状态代表中间推理路径,而动作则由从预定义模型池中选择的语言模型生成下一步推理。受过程基准模型奖励的指导,LE-MCTS 对由不同语言模型生成的推理步骤进行树状搜索,以识别最准确的推理链。在五个数学推理基准测试上的实验结果表明,我们的方法既优于单一语言模型解码算法,也优于语言模型集成方法。值得注意的是,LE-MCTS 在 MATH 和 MQA 数据集上分别提升了 3.6% 和 4.3%,凸显了其在解决复杂推理问题方面的有效性。

关键词

引用

@article{arxiv.2412.15797,
  title  = {Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning},
  author = {Sungjin Park and Xiao Liu and Yeyun Gong and Edward Choi},
  journal= {arXiv preprint arXiv:2412.15797},
  year   = {2024}
}