中文

通过内在自我批判增强 LLM 规划能力

机器学习 2026-01-01 v1 人工智能

摘要

我们展示了一种让 LLM 批判其自身答案的方法,旨在提升其性能,从而在既定的规划基准上带来显著改进。尽管早期研究对 LLM 利用自我批判方法的有效性提出了质疑,但我们展示了在没有验证器等外部来源的情况下,通过内在自我批判,在积木世界(Blocksworld)领域的规划数据集上取得了显著的性能提升。我们还在物流(Logistics)和迷你网格(Mini-grid)数据集上展示了类似的改进,超过了强大的基线准确率。我们采用少样本学习技术,并将其逐步扩展为多样本方法作为我们的基础方法,并证明通过采用迭代的修正与优化过程,有可能在这种已经具有竞争力的方法之上获得实质性提升。我们阐释了自我批判如何能显著提升规划性能。我们的实证结果在所考虑的模型类别(即 2024 年 10 月的 LLM 模型检查点)上呈现了新的最优水平。我们的主要关注点在于方法本身,展示了内在的自我改进能力,这种能力与具体的模型版本无关,并且我们相信,将我们的方法应用于更复杂的搜索技术和更强大的模型将带来更好的性能。

关键词

引用

@article{arxiv.2512.24103,
  title  = {Enhancing LLM Planning Capabilities through Intrinsic Self-Critique},
  author = {Bernd Bohnet and Pierre-Alexandre Kamienny and Hanie Sedghi and Dilan Gorur and Pranjal Awasthi and Aaron Parisi and Kevin Swersky and Rosanne Liu and Azade Nova and Noah Fiedel},
  journal= {arXiv preprint arXiv:2512.24103},
  year   = {2026}
}