中文

REPAINT:深度强化学习中的知识迁移

机器学习 2021-05-27 v3 人工智能 机器人学

摘要

通过利用先前学习的任务来加速复杂任务的学习过程,一直是强化学习中最具挑战性的问题之一,尤其在源任务与目标任务相似度较低时。本文提出一种用于深度强化学习中知识迁移的表示与实例迁移(REPAINT)算法。REPAINT不仅在策略内学习中迁移预训练教师策略的表示,还使用基于优势的经验选择方法,在离策略学习中迁移遵循教师策略收集的有用样本。我们在若干基准任务上的实验结果表明,REPAINT在任务相似度的一般情况下显著减少了总训练时间。特别地,当源任务与目标任务不相似或为其子任务时,REPAINT在训练时间缩减和回报分数的渐近性能上均优于其他基线方法。

关键词

引用

@article{arxiv.2011.11827,
  title  = {REPAINT: Knowledge Transfer in Deep Reinforcement Learning},
  author = {Yunzhe Tao and Sahika Genc and Jonathan Chung and Tao Sun and Sunil Mallya},
  journal= {arXiv preprint arXiv:2011.11827},
  year   = {2021}
}

备注

Published at ICML 2021