中文

面向 Atari 的强化学习域适应

机器学习 2018-12-19 v1 人工智能 机器学习

摘要

深度强化学习智能体近来在多种离散与连续控制任务中取得成功;然而,它们训练缓慢,且需要与环境大量交互才能学到合适策略。这源于强化学习智能体对世界无先验知识、无已有数据可依,因而必须投入大量时间进行探索。迁移学习可通过利用在某源任务上的学习成果来辅助某目标任务的学习,从而缓解部分问题。我们的工作提出了一种用于初始化目标任务隐藏特征表示的算法。我们提出一种域适应方法来迁移状态表示,并展示了跨域、跨任务及跨动作空间的迁移。我们结合了对抗域适应思想与对抗自编码器架构。我们将新策略的表示空间与预训练的源策略对齐,所用目标任务数据由随机策略生成。我们证明该初始化步骤在学习新的强化学习任务时带来显著提升,这凸显了对抗适应方法的广泛适用性;即便任务与标签/动作空间发生变化时亦然。

关键词

引用

@article{arxiv.1812.07452,
  title  = {Domain Adaptation for Reinforcement Learning on the Atari},
  author = {Thomas Carr and Maria Chli and George Vogiatzis},
  journal= {arXiv preprint arXiv:1812.07452},
  year   = {2018}
}