中文

ToTRL:通过解谜任务发掘 LLM 树状思考推理潜能

计算与语言 2025-12-29 v2

摘要

大型语言模型(LLM)展现出显著的推理能力,尤其通过长链式思维(CoT)过程,这可以通过强化学习(RL)来激发。然而,过长的 CoT 推理存在局限,主要表现为因过度内省导致输出冗长。这些 LLM 的推理过程往往似乎遵循试错方法,而非系统、逻辑的推导。在 contrast 中,树状思考(ToT)提供了更为先进的方法,通过在树结构中建模推理过程。这种推理结构促进了多个推理分支的并行生成与评估,使能够主动识别、评估并剪枝无生产路径。这可能导致性能提升并降低 token 成本。基于 LLM 的长 CoT 能力,我们引入树状思考 RL(ToTRL),一种基于规则奖励的全新 on-policy RL 框架。ToTRL 旨在引导 LLM 开发基于顺序 CoT 策略的并行 ToT 策略。此外,我们在 ToTRL 训练过程中让 LLM 作为玩家进行谜题游戏。解谜游戏本质上需要探索相互依赖的选择并管理多个约束,这需要构建和探索思考树,为培养 ToT 推理能力提供具有挑战性的任务。我们的实证评估表明,借助 ToTRL 训练的 ToTQwen3-8B 模型在复杂推理任务上实现了显著的性能和推理效率提升。

关键词

引用

@article{arxiv.2505.12717,
  title  = {ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving},
  author = {Haoyuan Wu and Xueyi Chen and Rui Ming and Jilong Gao and Shoubo Hu and Zhuolun He and Bei Yu},
  journal= {arXiv preprint arXiv:2505.12717},
  year   = {2025}
}