生成式演员-评论家
机器学习
2025-12-29 v1
摘要
传统强化学习(RL)算法通常聚焦于估计或最大化预期收益,在用在线经验细化离线预训练模型时面临挑战。本文提出生成式演员-评论家(Generative Actor Critic, GAC),一种新型框架,通过将策略评估重新建模为学习轨迹与回报联合分布 的生成模型,以及将策略改进建模为对该学习模型进行灵活推断来实现解耦。为实现 GAC,我们提出一种基于潜变量模型的具体实现,特点是具有连续潜在计划向量。我们开发了针对两种推断策略:一种是通过优化潜在计划以最大化预期回报进行“利用”,另一种是基于动态调整的目标回报对潜在计划进行条件抽样以实现“探索”。在 Gym-MuJoCo 和 Maze2D 基准测试中,实验表明 GAC 在离线性能方面表现强劲,且在无步级奖励情况下,离线到在线的改进显著优于最先进的方法。
引用
@article{arxiv.2512.21527,
title = {Generative Actor Critic},
author = {Aoyang Qin and Deqian Kong and Wei Wang and Ying Nian Wu and Song-Chun Zhu and Sirui Xie},
journal= {arXiv preprint arXiv:2512.21527},
year = {2025}
}