探讨树状思维何时成功:大型模型在生成方面优于判别
计算与语言
2024-10-25 v2
摘要
树状思维 (Tree of Thoughts, ToT) 是一种面向大型语言模型 (LLMs) 的推理策略,该策略采用生成器来提建议推理步骤,并采用判别器来决定要实施哪些步骤。ToT 在推理任务上表现出强大的性能,常常超越简单的输入-输出 (Input-Output, IO) 提示和链式思维 (Chain-of-Thought, CoT) 推理方法。然而,ToT 并不在所有模型上都一致优于此类简单方法,这留下了大量关于 ToT 最有益处的条件之间的知识空白。本文分析了生成器和判别器的作用,以更好地理解 ToT 在何时获益的条件。我们发现,生成器在推动 ToT 成功方面发挥更关键的作用 than 判别器。扩大生成器的规模可导致 ToT 性能的显著提升,即使使用较小的模型作为判别器;而使用固定生成器扩大判别器规模仅导致边际收益。我们的结果表明,不同规模的模型在判别能力方面表现相当,但在 ToT 的生成性能方面存在显著差异。
引用
@article{arxiv.2410.17820,
title = {Understanding When Tree of Thoughts Succeeds: Larger Models Excel in Generation, Not Discrimination},
author = {Qiqi Chen and Xinpeng Wang and Philipp Mondorf and Michael A. Hedderich and Barbara Plank},
journal= {arXiv preprint arXiv:2410.17820},
year = {2024}
}
备注
Code: github.com/mainlp/tot-eval