用于协调多智能体强化学习的似然分位数网络
机器学习
2020-06-16 v6 机器学习
摘要
当多个智能体以去中心化方式学习时,由于其他智能体的探索与学习,从单个智能体的视角看环境是非平稳的。近期提出的深度多智能体强化学习方法试图通过判断哪些样本来自其他智能体的探索或次优性,并在学习中较少考虑它们,从而缓解这种非平稳性。基于相同理念,本文引入一种去中心化分位数估计器,旨在通过基于回报似然区分非平稳样本来提升性能。具体而言,每个智能体考虑其他智能体正在发生探索与策略改变的可能性,本质上利用智能体自身的估计来权衡应施加于给定样本的学习率。我们提出了计算回报分布表示差异的规范方法,以及利用该差异引导更新的方法。我们还探讨了风险寻求策略对随时间调整学习的影响,并提出了引导风险敏感性的自适应风险扭曲函数。我们在传统基准和新领域上的实验表明,相较先前方法,我们的方法更稳定、样本效率更高,且更有可能收敛到联合最优策略。
引用
@article{arxiv.1812.06319,
title = {Likelihood Quantile Networks for Coordinating Multi-Agent Reinforcement Learning},
author = {Xueguang Lyu and Christopher Amato},
journal= {arXiv preprint arXiv:1812.06319},
year = {2020}
}