中文

利用策略蒸馏与仿真到真实迁移在真实环境中部署的持续强化学习

机器学习 2019-06-12 v1 机器人学 机器学习

摘要

我们聚焦于教机器人解决顺序呈现任务的问题,即在持续学习场景中。机器人应能解决其遇到的所有任务,且不遗忘过往任务。我们提供了将强化学习应用于此类场景的初步工作,针对一个三轮全向机器人的二维导航任务。我们的方法利用了状态表征学习和策略蒸馏。策略使用学习到的特征而非原始观测作为输入进行训练,从而获得更好的样本效率。策略蒸馏用于将多个策略合并为一个能解决所有已遇任务的单一策略。

关键词

引用

@article{arxiv.1906.04452,
  title  = {Continual Reinforcement Learning deployed in Real-life using Policy Distillation and Sim2Real Transfer},
  author = {René Traoré and Hugo Caselles-Dupré and Timothée Lesort and Te Sun and Natalia Díaz-Rodríguez and David Filliat},
  journal= {arXiv preprint arXiv:1906.04452},
  year   = {2019}
}

备注

accepted to the Workshop on Multi-Task and Lifelong Reinforcement Learning, ICML 2019