链路无意识?对规划中 CoT 的分析
分布式、并行与集群计算
2024-05-09 v1
摘要
大型语言模型 (LLM) 在推理问题上的表现通常难以在分布之外推广。以往研究声称可通过链式思维 (chain of thought) 提示来缓解这一问题——该方法通过演示解题程序来实现,直觉上可通过 in-context 教学 LLM 解决问题的算法。本文对块世界 (Blocksworld) 中的问题进行案例研究,考察两种最先进 LLM 在两个维度上的表现:提示中示例的普适性以及每个提示查询问题的复杂度。虽然我们的問題非常简单,但我们仅在提示中显示的栈大小超过查询指定栈大小 n 时,才发现链式思维提示带来实质性的性能提升。我们还创建了三个常见于以往 CoT 论文中的可扩展领域,展示了类似的失效模式。我们的結果暗示,与以往文献的声称相反,CoT 的性能提升并不源于模型通过演示学习通用算法程序,而是依赖于精心设计的高度问题特定提示。这凸显了链式思维的缺点,尤其是在生成正确推理痕迹的示例方面的性能提升与人力成本之间的尖锐权衡。
引用
@article{arxiv.2405.04775,
title = {Determining Recoverable Consensus Numbers},
author = {Sean Ovens},
journal= {arXiv preprint arXiv:2405.04775},
year = {2024}
}