中文

大语言模型真能通过自我批评自身规划而改进吗?

人工智能 2023-10-13 v1

摘要

关于大语言模型(Large Language Models, LLMs)能够以迭代方式成功验证或自我批评其在推理问题中的候选解,已有广泛宣称。受这些宣称启发,本文着手研究大语言模型在规划背景下的验证/自我批评能力。我们评估了一个采用 LLM 同时进行规划生成与验证的规划系统。我们针对真实验证评估验证 LLM 的性能、自我批评对规划生成的影响,以及不同反馈层级对系统性能的影响。使用最先进的 LLM GPT-4 进行生成与验证,我们的发现揭示:自我批评似乎削弱了规划生成性能,尤其相较于具备外部可靠验证器的系统;且该系统内的 LLM 验证器产生大量假阳性,损害了系统可靠性。此外,反馈的性质(二值或详细)对规划生成影响甚微。总体而言,我们的结果令人对 LLM 在规划任务中自我批评迭代框架的有效性产生怀疑。

关键词

引用

@article{arxiv.2310.08118,
  title  = {Can Large Language Models Really Improve by Self-critiquing Their Own Plans?},
  author = {Karthik Valmeekam and Matthew Marquez and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2310.08118},
  year   = {2023}
}