大语言模型在推理与规划任务中的自验证局限性
人工智能
2024-08-06 v2
摘要
关于大语言模型(LLMs)的推理能力存在相当大的意见分歧。虽然最初认为推理能力会随规模自动涌现的乐观情绪已因一系列反例(从乘法到简单规划)而减弱,但仍普遍存在一种信念,即 LLMs 能够以迭代方式自我批判并改进其解决方案。这种信念似乎基于一个假设:验证正确性应比生成更容易——这是计算复杂性中的一个经典论点——但在 LLMs 所做的是近似检索的程度上,该论点应与其无关。在本文中,我们着手系统地研究迭代提示在推理和规划背景下的有效性。我们对 GPT-4 在三个领域(24 点游戏、图着色和 STRIPS 规划)的表现进行了原则性的实证研究。我们既实验了模型批判其自身答案的情况,也实验了由外部正确推理器验证提议解决方案的情况。在每种情况下,我们分析了批评内容是否实际影响了最终性能,以及我们是否可以在不损失性能的情况下消融增强系统的元素。我们观察到自批判导致显著的性能崩溃,而可靠的外部验证则带来显著的性能提升。我们还注意到,仅使用可靠验证器重新提示即可保留更复杂设置的大部分益处。
引用
@article{arxiv.2402.08115,
title = {On the Self-Verification Limitations of Large Language Models on Reasoning and Planning Tasks},
author = {Kaya Stechly and Karthik Valmeekam and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2402.08115},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2310.12397