中文

用于多任务强化学习的自举潜变量预测表示

机器学习 2020-05-01 v1 人工智能

摘要

学习良好的表示是深度强化学习(RL)的关键组成部分。表示学习在多任务和部分可观测设定中尤为重要,其中构建未知环境的表示对完成任务至关重要。本文提出预测自举潜变量(PBL),一种简单灵活的多任务深度 RL 自监督表示学习算法。PBL 建立在未来观测的多步预测表示之上,并聚焦于捕捉关于环境动力学的结构化信息。具体而言,PBL 通过预测未来观测的潜嵌入来训练其表示。这些潜嵌入本身被训练为可预测前述表示。这些预测形成自举效应,使智能体更多地了解环境动力学的关键方面。此外,通过在潜空间完全定义预测任务,PBL 提供了使用涉及像素图像、语言指令、奖励等多模态观测的灵活性。我们在实验中表明,在 DMLab-30 和 Atari-57 多任务设定中,PBL 相较最先进的深度 RL 智能体实现了全面的性能提升。

关键词

引用

@article{arxiv.2004.14646,
  title  = {Bootstrap Latent-Predictive Representations for Multitask Reinforcement Learning},
  author = {Daniel Guo and Bernardo Avila Pires and Bilal Piot and Jean-bastien Grill and Florent Altché and Rémi Munos and Mohammad Gheshlaghi Azar},
  journal= {arXiv preprint arXiv:2004.14646},
  year   = {2020}
}