GMAC:演员-评论家框架的分布视角
机器学习
2021-07-16 v2
摘要
在本文中,我们设计了一种关于演员-评论家的分布框架,作为对分布不稳定性、动作类型限制以及样本与统计量混淆问题的解决方案。我们提出一种新方法,最小化由新颖的记为 SR() 的样本替换算法生成的多步 Bellman 目标分布之间的 Cramér 距离,该算法在多个 Bellman 操作下学习正确的值分布。用高斯混合模型参数化值分布进一步提升了方法的效率与性能,我们将其命名为 GMAC。我们通过实验表明,GMAC 在离散与连续动作空间中使用 Arcade Learning Environment (ALE) 和 PyBullet 环境,均以低计算成本捕获了值分布的正确表示并提升了传统演员-评论家方法的性能。
引用
@article{arxiv.2105.11366,
title = {GMAC: A Distributional Perspective on Actor-Critic Framework},
author = {Daniel Wontae Nam and Younghoon Kim and Chan Y. Park},
journal= {arXiv preprint arXiv:2105.11366},
year = {2021}
}