自然语言 Actor-Critic:语言空间中的可扩展无策略学习
机器学习
2026-02-04 v2 计算与语言
摘要
大型语言模型(LLM)代理——即在长时间尺度上与环境动态交互的 LLM——正成为越来越重要的研究领域,使自动化在涉及工具使用、网页浏览与与人对话的复杂任务中成为可能。在缺乏专家演示的情况下,训练 LLM 代理依赖于优化以稀疏奖励函数为准的策略梯度方法。然而,在奖励稀疏的长期任务中,基于轨迹级奖励的学习可能较噪声,导致训练不稳定且样本复杂度高。此外,策略改进依赖于通过探索发现更好的动作,而当动作位于自然语言空间时,这种探索可能比较困难。本文提出了自然语言 Actor-Critic(NLAC),一种新型的 actor-critic 算法,通过产生自然语言而非标量值的生成式 LLM 批评家来训练 LLM 策略。该方法利用 LLM 的固有优势,提供更丰富、更可操作的训练信号;特别是在动作空间大且开放的任务中,针对动作不佳性质的自然语言解释对 LLM 策略推理如何改进其动作非常有用,而无需依赖随机探索。此外,我们的方法可以在无策略梯度的情况下进行离策略训练,为现有基于策略的方法提供更数据高效且更稳定的替代方案。我们在推理、网页浏览和工具使用结合对话任务上展示了结果,表明 NLAC 在超越现有训练方法方面具有潜力,并为 LLM 代理提供了更可扩展、更稳定的训练范式。
引用
@article{arxiv.2512.04601,
title = {Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space},
author = {Joey Hong and Kang Liu and Zhan Ling and Jiecao Chen and Sergey Levine},
journal= {arXiv preprint arXiv:2512.04601},
year = {2026}
}
备注
21 pages, 4 figures