中文

面向迁移强化学习的通用后继表示

人工智能 2018-04-12 v1 机器学习 机器学习

摘要

迁移强化学习的目标是从一组先前任务泛化到未见过的新任务。本工作中,我们关注任务间动力学相同但目标不同的迁移场景。尽管通用值函数(Sutton 等,2011)已被证明对知识迁移有用,但在实践中学习一个通用值函数可能具有挑战性。为此,我们提出(1)使用通用后继表示(Universal Successor Representations, USR)来表示可迁移知识,以及(2)一种可通过与环境交互进行训练的 USR 近似器(USRA)。我们的实验表明,USR 可有效应用于新任务,且由训练好的 USRA 初始化的智能体比随机初始化更快地达成目标。

关键词

引用

@article{arxiv.1804.03758,
  title  = {Universal Successor Representations for Transfer Reinforcement Learning},
  author = {Chen Ma and Junfeng Wen and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1804.03758},
  year   = {2018}
}