中文

SAC-GLAM:结合软演员-评论家与 hindsight 重标的在线强化学习提升 LLM 智能体

机器学习 2026-01-30 v3 人工智能

摘要

过去几年来,大语言模型(LLM)不仅作为生成模型,更作为解决文本序列决策任务的智能体努力不懈。当面对复杂环境且零样本能力不足时,最近的工作表明可以在线强化学习(RL)可用于 LLM 智能体交互式发现和学习高效策略。然而,大多数先前工作依赖于 on-policy 算法,这大大限制了智能体在探索和利用方面能够采用的方法,如经验回放和 hindsight 重标。然而,这些方法可能是 LLM 学习智能体的关键,特别是在设计自我动机的智能体以采样并追求自身目标(即 autotelic 智能体)时。本文提出并研究了将软演员-评论家(Soft Actor-Critic)与 hindsight 重标适用于 LLM 智能体的方法。我们的方法不仅为自我动机的 LLM 智能体在线学习铺路,还能在更经典的多目标 RL 环境中超越 on-policy 方法。

关键词

引用

@article{arxiv.2410.12481,
  title  = {SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling},
  author = {Loris Gaven and Clement Romac and Thomas Carta and Sylvain Lamprier and Olivier Sigaud and Pierre-Yves Oudeyer},
  journal= {arXiv preprint arXiv:2410.12481},
  year   = {2026}
}

备注

This work has been presented at the IMOL workshop at NeurIPS 2025 (https://neurips.cc/virtual/2024/101058)