中文

并发元强化学习

人工智能 2019-03-08 v1

摘要

最先进的元强化学习算法通常假设单个智能体以顺序方式与环境中交互的设置。这种顺序执行范式的一个负面副作用是,随着环境变得越来越具有挑战性,从而需要元学习器更多的交互回合,它要求智能体在越来越长的时间尺度上进行推理。为了应对长时间尺度信用分配的难度,我们提出了一种替代的并行框架,将其命名为“并发元强化学习”(Concurrent Meta-Reinforcement Learning,CMRL),该框架将时间信用分配问题转化为多智能体强化学习问题。在此多智能体设置中,一组并行智能体在同一环境中执行,并且这些“展开”智能体中的每一个都被赋予彼此通信的手段。通信的目标是以协作方式协调智能体当前分配到的共享任务的最有效探索。因此,这种协调代表了该框架的元学习方面,因为每个智能体可以被分配或自行分配当前任务状态空间的特定部分。该框架与假设每个并行展开独立发生的标准RL方法形成对比,如果许多展开最终采样状态空间的同一部分,这可能会浪费计算。此外,并行设置使我们能够定义若干奖励共享函数和辅助损失,这些在顺序设置中应用并非易事。我们证明了所提出的CMRL在各种具有挑战性的任务中相对于顺序方法具有改进效果。

关键词

引用

@article{arxiv.1903.02710,
  title  = {Concurrent Meta Reinforcement Learning},
  author = {Emilio Parisotto and Soham Ghosh and Sai Bhargav Yalamanchi and Varsha Chinnaobireddy and Yuhuai Wu and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:1903.02710},
  year   = {2019}
}