GPT-4 不知自己错了:关于推理问题中迭代提示的分析
人工智能
2023-10-20 v1
摘要
关于大语言模型(LLMs)的推理能力,业界意见分歧显著。尽管随着大量反例的出现,推理可能随规模自动涌现的初期乐观态度已有所降温,但对其迭代自我批判能力的广泛信念依然存在。本文中,我们着手系统研究 LLMs 在图着色这一典型 NP 完全推理问题(与命题可满足性以及调度、分配等实际问题相关)背景下的迭代提示有效性。我们针对 GPT-4 求解图着色实例或验证候选着色正确性的表现开展了严谨的实证研究。在迭代模式中,我们实验了模型批判自身答案以及由外部正确推理器验证所提方案的设置。在两种情况下,我们都分析了批评的内容是否实际影响最终性能。研究似乎表明:(i)LLMs 不擅长求解图着色实例;(ii)它们在验证解方面并不更好——因此在 LLM 批判 LLM 生成解的迭代模式中无效;(iii)批评的正确性与内容——无论来自 LLM 还是外部求解器——似乎与迭代提示的性能基本无关。我们展示了所观察到的有效性提升很大程度上源于正确解侥幸出现在提示的 top-k 补全中(并被外部验证器识别)。因此,我们的结果对最先进 LLMs 的自我批判能力相关主张提出了质疑。
引用
@article{arxiv.2310.12397,
title = {GPT-4 Doesn't Know It's Wrong: An Analysis of Iterative Prompting for Reasoning Problems},
author = {Kaya Stechly and Matthew Marquez and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2310.12397},
year = {2023}
}
备注
18 pages, 3 figures