中文

基于经验共享的分布式多任务强化学习扩展

机器学习 2023-07-13 v1 人工智能

摘要

近期,DARPA启动了ShELL计划,旨在探索经验共享如何帮助分布式终身学习智能体适应新挑战。本文通过对分布式多任务强化学习(RL)进行理论与实证研究来解决该问题,其中一组N个智能体协作解决M个任务,且事先不知其身份。我们将该问题建模为线性参数化上下文马尔可夫决策过程(MDPs),其中每个任务由一个指定转移动态与奖励的上下文表示。为求解此问题,我们提出一种称为DistMT-LSVI的算法。首先,智能体识别任务,然后通过中央服务器交换信息,以推导出各任务的ε-最优策略。我们的研究表明,要使所有M个任务均达到ε-最优策略,使用DistMT-LSVI的单个智能体所需运行的总回合次数至多为\tilde{\mathcal{O}}({d^3H^6(\epsilon^{-2}+c_{\rm sep}^{-2})}\cdot M/N),其中c_{\rm sep}>0为表示任务可分离性的常数,H为每回合的步数 horizon,d为动态与奖励的特征维度。值得注意的是,DistMT-LSVI将非分布式设置的样本复杂度改善了1/N倍,因为在非分布式下每个智能体独立学习所有M个任务的ε-最优策略需使用\tilde{\mathcal{O}}(d^3H^6M\epsilon^{-2})回合。此外,我们在OpenAI Gym Atari环境中进行了数值实验,验证了我们的理论发现。

关键词

引用

@article{arxiv.2307.05834,
  title  = {Scaling Distributed Multi-task Reinforcement Learning with Experience Sharing},
  author = {Sanae Amani and Khushbu Pahwa and Vladimir Braverman and Lin F. Yang},
  journal= {arXiv preprint arXiv:2307.05834},
  year   = {2023}
}