RMIX:为协作强化学习智能体学习风险敏感策略
机器学习
2021-03-23 v3 多智能体系统
摘要
当前基于值的多智能体强化学习方法通过集中训练与分散执行(CTDE)优化个体Q值以引导个体行为。然而,即便借助CTDE,此类期望的(即风险中性的)Q值仍不充分,原因在于奖励的随机性与环境的不确定性,导致这些方法在复杂环境中训练协作智能体时失败。为解决这些问题,我们提出RMIX,一种新颖的协作MARL方法,对个体Q值所学分布采用条件风险价值(CVaR)度量。具体而言,我们首先学习个体的回报分布,以解析计算CVaR用于分散执行。接着,为处理执行期间随机结果的时序特性,我们提出动态风险水平预测器以调节风险水平。最后,我们以CVaR值用于在集中训练时估计TD误差中的目标来优化CVaR策略,且CVaR值用作辅助局部奖励通过分位数回归(Quantile Regression)损失更新局部分布。经实验,我们表明该方法在具挑战性的StarCraft II任务上显著优于最先进方法,展现出增强的协调性与改进的样本效率。
引用
@article{arxiv.2102.08159,
title = {RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents},
author = {Wei Qiu and Xinrun Wang and Runsheng Yu and Xu He and Rundong Wang and Bo An and Svetlana Obraztsova and Zinovi Rabinovich},
journal= {arXiv preprint arXiv:2102.08159},
year = {2021}
}
备注
ICLR 2021 submission version: https://openreview.net/forum?id=1EVb8XRBDNr