中文

语言灯塔:通过批判性引导提升大语言模型代理

计算与语言 2025-10-28 v2 人工智能

摘要

大语言模型 (LLM) 最近已从基于文本的助手转变为能够进行规划、推理和迭代改进其动作的自主代理。虽然数值奖励信号和验证器可以有效地对候选动作进行排序,但往往提供有限的上下文指导。相比之下,自然语言反馈更符合 LLM 的生成能力,提供更丰富且可操作的建议。然而,有效地解析和实施这些反馈对基于 LLM 的代理来说仍具有挑战性。本文引入批判性引导改进 (CGI),一种新颖的双人框架,包括探索环境的演员模型和生成详细自然语言反馈的批评家模型。通过训练批评家产出细粒度评估和可操作的修订,并训练演员利用这些批判,我们的方法促进了对备选策略的更稳健的探索,同时避免局部最优。三个交互式环境中的实验表明,CGI 相对于现有基线实现了显著的优势。值得注意的是,即使是小型批评家模型也超越了 GPT-4 在反馈质量方面的表现。 resulting actor 实现了最先进的性能,证明了明确的迭代性指导在增强 LLM 基于代理的决策方面的强大能力。

关键词

引用

@article{arxiv.2503.16024,
  title  = {The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement},
  author = {Ruihan Yang and Fanghua Ye and Jian Li and Siyu Yuan and Yikai Zhang and Zhaopeng Tu and Xiaolong Li and Deqing Yang},
  journal= {arXiv preprint arXiv:2503.16024},
  year   = {2025}
}

备注

NeurIPS 2025