中文

个性化策略下元强化学习算法的收敛理论探讨

人工智能 2022-09-22 v1 机器学习

摘要

现代元强化学习(Meta-RL)方法主要基于模型无关元学习发展而来,该方法跨任务执行策略梯度步以最大化策略性能。然而,梯度冲突问题在 Meta-RL 中仍鲜被理解,当遇到不同任务时可能导致性能下降。为应对这一挑战,本文提出一种新颖的个性化 Meta-RL(pMeta-RL)算法,其聚合任务特定的个性化策略以更新用于所有任务的元策略,同时在元策略约束下保持个性化策略以最大化各任务的平均回报。我们还在表格设定下提供了理论分析,证明了 pMeta-RL 算法的收敛性。此外,我们将所提 pMeta-RL 算法扩展至基于软 actor-critic 的深度网络版本,使其适用于连续控制任务。实验结果表明,所提算法在 Gym 与 MuJoCo 测试套件上优于其他以往的 Meta-RL 算法。

关键词

引用

@article{arxiv.2209.10072,
  title  = {On the Convergence Theory of Meta Reinforcement Learning with Personalized Policies},
  author = {Haozhi Wang and Qing Wang and Yunfeng Shao and Dong Li and Jianye Hao and Yinchuan Li},
  journal= {arXiv preprint arXiv:2209.10072},
  year   = {2022}
}