中文

基于课程式任务采样的鲁棒元强化学习

机器学习 2022-04-01 v1

摘要

元强化学习 (meta-RL) 习得在广泛任务分布中表现良好的元策略。然而,常规 meta-RL 通过随机采样任务来学习元策略,已被指出会对特定任务(尤其是智能体易获高分的简单任务)产生元过拟合。为减轻元过拟合影响,我们考虑采用基于课程的任务采样的 meta-RL。我们的方法为基于引导任务采样的鲁棒元强化学习 (RMRL-GTS),其依据分数与训练轮次限制任务采样,是一种有效方法。我们表明,要实现鲁棒 meta-RL,不仅需密集采样低分任务,还需限制并扩展待采样任务的任务区域。

关键词

引用

@article{arxiv.2203.16801,
  title  = {Robust Meta-Reinforcement Learning with Curriculum-Based Task Sampling},
  author = {Morio Matsumoto and Hiroya Matsuba and Toshihiro Kujirai},
  journal= {arXiv preprint arXiv:2203.16801},
  year   = {2022}
}