中文

Meta-Q-Learning

机器学习 2020-04-07 v2 机器学习

摘要

本文提出 Meta-Q-Learning (MQL),一种用于元强化学习(meta-RL)的新离线策略算法。MQL 基于三个简单思想。首先,我们表明若给定作为过去轨迹表示的上下文变量,Q-learning 可与最先进的 meta-RL 算法竞争。其次,最大化训练任务上平均奖励的多任务目标是元训练 RL 策略的有效方法。第三,来自元训练回放缓冲区的过去数据可通过离线更新被回收以在新任务上调整策略。MQL 借此利用倾向估计中的思想,从而扩增可用于调整的数据量。在标准连续控制基准上的实验表明,MQL 与 meta-RL 中的最先进水平相比具有优势。

关键词

引用

@article{arxiv.1910.00125,
  title  = {Meta-Q-Learning},
  author = {Rasool Fakoor and Pratik Chaudhari and Stefano Soatto and Alexander J. Smola},
  journal= {arXiv preprint arXiv:1910.00125},
  year   = {2020}
}

备注

ICLR 2020 conference paper