CGAR:强化学习中的评论家引导动作重分配
机器学习
2022-06-24 v1
摘要
训练游戏玩法的强化学习智能体需要与环境进行多次交互。无知的随机探索可能导致时间与资源浪费,缓解此类浪费至关重要。如本文所讨论,在离策略行动者-评论家算法设定下,我们证明评论家能带来比行动者更高或至少相等的期望折扣回报。因此,由评论家预测的Q值是重分配最初从行动者预测的策略分布中采样所得动作的更好信号。本文引入新颖的评论家引导动作重分配(CGAR)算法,并在OpenAI MuJoCo任务上测试。实验结果表明,我们的方法提升了样本效率并达到最先进性能。我们的代码见 https://github.com/tairanhuang/CGAR。
引用
@article{arxiv.2206.11494,
title = {CGAR: Critic Guided Action Redistribution in Reinforcement Leaning},
author = {Tairan Huang and Xu Li and Hao Li and Mingming Sun and Ping Li},
journal= {arXiv preprint arXiv:2206.11494},
year = {2022}
}
备注
IEEE Conference on Games (CoG), 2022