中文

基于多时间尺度回放的持续强化学习

机器学习 2020-04-17 v1 人工智能 机器学习

摘要

本文提出一种多时间尺度回放(multi-timescale replay, MTR)缓冲,用于改进面临随时间持续变化且变化时间尺度对智能体未知环境的RL智能体的持续学习。基本MTR缓冲由在不同时间尺度累积经验的子缓冲级联构成,使智能体能够改善对新数据的适应与对旧知识的保留之间的权衡。我们还将MTR框架与不变风险最小化结合,旨在鼓励智能体学习随时间在各类所遇环境中均鲁棒的策略。MTR方法在两项连续控制任务的三种不同持续学习设置中得到评估,且在许多情况下较基线有所提升。

关键词

引用

@article{arxiv.2004.07530,
  title  = {Continual Reinforcement Learning with Multi-Timescale Replay},
  author = {Christos Kaplanis and Claudia Clopath and Murray Shanahan},
  journal= {arXiv preprint arXiv:2004.07530},
  year   = {2020}
}