中文

用于强化学习中目标条件迁移学习的预训练词嵌入

机器学习 2020-07-13 v1 人工智能 机器学习

摘要

强化学习(RL)算法通常从白板状态开始,不具备关于环境的任何先验知识,也不具备任何先验技能。然而这常常导致低样本效率,需要与 environment 进行大量交互。在终身学习的设定中尤其如此,其中智能体需要持续扩展其能力。在本文中,我们考察预训练的任务无关语言模型如何使目标条件 RL 智能体更具样本效率。我们通过促进不同相关任务之间的迁移学习来实现这一点。我们在一组物体导航任务上实验性地展示了我们的方法。

关键词

引用

@article{arxiv.2007.05196,
  title  = {Pre-trained Word Embeddings for Goal-conditional Transfer Learning in Reinforcement Learning},
  author = {Matthias Hutsebaut-Buysse and Kevin Mets and Steven Latré},
  journal= {arXiv preprint arXiv:2007.05196},
  year   = {2020}
}

备注

Paper accepted to the ICML 2020 Language in Reinforcement Learning (LaReL) Workshop