中文

通过模型辨识与经验重标实现鲁棒于分布偏移的元强化学习

机器学习 2020-06-17 v2 机器学习

摘要

强化学习算法能够自主习得复杂任务策略。然而,学习多样化技能所需的样本数量可能大得令人望而却步。尽管元强化学习方法已使智能体能够利用先验经验快速适应新任务,其性能关键取决于新任务与既往任务之接近程度。现有方法要么外推能力不佳,要么以在策略元训练需极大量数据为代价方可外推。本工作中,我们提出模型辨识与经验重标(MIER),一种高效且能在测试时面对分布外任务良好外推的元强化学习算法。我们的方法基于一个简单洞见:我们认识到动力学模型可比策略与值函数更高效地用离策略数据一致适配。这些动力学模型随后可用于为新任务生成合成经验,从而在完全不使用元强化学习的情况下继续训练策略与值函数。

关键词

引用

@article{arxiv.2006.07178,
  title  = {Meta-Reinforcement Learning Robust to Distributional Shift via Model Identification and Experience Relabeling},
  author = {Russell Mendonca and Xinyang Geng and Chelsea Finn and Sergey Levine},
  journal= {arXiv preprint arXiv:2006.07178},
  year   = {2020}
}