基于分层评论家的强化学习
机器学习
2020-03-03 v4 多智能体系统
机器学习
摘要
在本研究中,我们探讨利用全局信息来加速竞争任务中强化学习(RL)的学习过程并提高其累积奖励。在 actor-critic 强化学习框架内,我们从两层层级中引入多个协作评论家,并提出一种基于分层评论家的强化学习(RLHC)算法。在我们的方法中,每个智能体从局部和全局评论家处接收关于竞争任务的价值信息,并以自顶向下的层级访问多个协作评论家。因此,每个智能体不仅接收底层细节,还考虑来自更高层次的协调,从而获得全局信息以改善训练性能。随后,我们在由网球和足球智能体竞争组成的 Unity 环境中,针对两种实验场景,将所提 RLHC 算法与基准算法近端策略优化(PPO)进行测试对比。结果表明,RLHC 在两项竞争任务上均优于基准算法。
引用
@article{arxiv.1902.03079,
title = {Reinforcement Learning from Hierarchical Critics},
author = {Zehong Cao and Chin-Teng Lin},
journal= {arXiv preprint arXiv:1902.03079},
year = {2020}
}
备注
This paper is submitted to IEEE TNNLS