中文

类 AlphaZero 的树搜索可引导大语言模型的解码与训练

机器学习 2024-02-12 v2 人工智能 计算与语言

摘要

近期如思维树(ToT)与通过规划推理(RAP)等工作旨在利用树搜索算法引导多步推理,从而增强 LLMs 的推理能力。这些方法依赖于提示预训练模型充当价值函数,并聚焦于低搜索深度的问题。因此,在预训练 LLM 缺乏足够知识充当有效价值函数的领域,或需要长程规划的领域,这些方法将失效。为应对这些局限,我们提出了一种用于 LLMs 的类 AlphaZero 树搜索学习框架(称为 TS-LLM),系统性地阐明了带有学习型价值函数的树搜索如何引导 LLM 解码。TS-LLM 在两个关键方面独具特色。(1)借助学习型价值函数与类 AlphaZero 算法,我们的方法可普遍适配于广泛任务、任意规模的语音模型以及不同搜索深度的任务。(2)我们的方法可在推理与训练阶段同时引导 LLMs,迭代地改进 LLM。在推理、规划、对齐与决策任务上的实证结果表明,TS-LLM 优于现有方法,并能处理深度为 64 的树。

关键词

引用

@article{arxiv.2309.17179,
  title  = {Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training},
  author = {Xidong Feng and Ziyu Wan and Muning Wen and Stephen Marcus McAleer and Ying Wen and Weinan Zhang and Jun Wang},
  journal= {arXiv preprint arXiv:2309.17179},
  year   = {2024}
}