中文

生成式演员-评论家

机器学习 2025-12-29 v1

摘要

传统强化学习(RL)算法通常聚焦于估计或最大化预期收益,在用在线经验细化离线预训练模型时面临挑战。本文提出生成式演员-评论家(Generative Actor Critic, GAC),一种新型框架,通过将策略评估重新建模为学习轨迹与回报联合分布 p(τ,y)p(\tau, y) 的生成模型,以及将策略改进建模为对该学习模型进行灵活推断来实现解耦。为实现 GAC,我们提出一种基于潜变量模型的具体实现,特点是具有连续潜在计划向量。我们开发了针对两种推断策略:一种是通过优化潜在计划以最大化预期回报进行“利用”,另一种是基于动态调整的目标回报对潜在计划进行条件抽样以实现“探索”。在 Gym-MuJoCo 和 Maze2D 基准测试中,实验表明 GAC 在离线性能方面表现强劲,且在无步级奖励情况下,离线到在线的改进显著优于最先进的方法。

关键词

引用

@article{arxiv.2512.21527,
  title  = {Generative Actor Critic},
  author = {Aoyang Qin and Deqian Kong and Wei Wang and Ying Nian Wu and Song-Chun Zhu and Sirui Xie},
  journal= {arXiv preprint arXiv:2512.21527},
  year   = {2025}
}