DARLA:改进强化学习中的零样本迁移
机器学习
2018-06-07 v2 人工智能
机器学习
摘要
领域自适应是深度强化学习(RL)中一个重要的开放问题。在许多感兴趣的情景中,数据难以获取,因此智能体可以在数据易于获取的环境中学习源策略,并期望其能良好地泛化到目标领域。我们提出了一种新的多阶段 RL 智能体 DARLA(解耦表示学习智能体,DisentAngled Representation Learning Agent),它先学会观察再学会行动。DARLA 的视觉基于学习观察环境的解耦表示。一旦 DARLA 能够观察,它就能获得对多种领域偏移具有鲁棒性的源策略——即使无法访问目标领域。DARLA 在零样本领域自适应情景中显著优于常规基线,这一效应在各种 RL 环境(Jaco 机械臂、DeepMind Lab)和基础 RL 算法(DQN、A3C 和 EC)中均成立。
引用
@article{arxiv.1707.08475,
title = {DARLA: Improving Zero-Shot Transfer in Reinforcement Learning},
author = {Irina Higgins and Arka Pal and Andrei A. Rusu and Loic Matthey and Christopher P Burgess and Alexander Pritzel and Matthew Botvinick and Charles Blundell and Alexander Lerchner},
journal= {arXiv preprint arXiv:1707.08475},
year = {2018}
}
备注
ICML 2017