一种用于多任务强化学习的去中心化策略梯度方法
机器学习
2021-05-31 v2 机器学习
摘要
我们基于一类策略梯度方法,建立了一个求解多任务强化学习(MTRL)问题的数学框架。MTRL的目标是学习一个在不同环境中均能有效运行的通用策略;这些环境具有相似(或重叠)的状态空间,但具有不同的奖励和动力学。我们强调了MTRL中两个在其单任务对应问题中不存在的基本挑战,并用简单示例加以说明。随后,我们提出了一种用于求解MTRL问题的去中心化熵正则化策略梯度方法,并研究了其有限时间收敛速率。我们通过一系列数值实验证明了所提方法的有效性。这些实验从小规模的“GridWorld”问题(可直观展示多任务学习中的权衡)到大规模问题(其中学习通用策略以在多个(模拟)环境中操控空中无人机)均有涵盖。
引用
@article{arxiv.2006.04338,
title = {A Decentralized Policy Gradient Approach to Multi-task Reinforcement Learning},
author = {Sihan Zeng and Aqeel Anwar and Thinh Doan and Arijit Raychowdhury and Justin Romberg},
journal= {arXiv preprint arXiv:2006.04338},
year = {2021}
}