面向迁移强化学习的通用后继表示
人工智能
2018-04-12 v1 机器学习
机器学习
摘要
迁移强化学习的目标是从一组先前任务泛化到未见过的新任务。本工作中,我们关注任务间动力学相同但目标不同的迁移场景。尽管通用值函数(Sutton 等,2011)已被证明对知识迁移有用,但在实践中学习一个通用值函数可能具有挑战性。为此,我们提出(1)使用通用后继表示(Universal Successor Representations, USR)来表示可迁移知识,以及(2)一种可通过与环境交互进行训练的 USR 近似器(USRA)。我们的实验表明,USR 可有效应用于新任务,且由训练好的 USRA 初始化的智能体比随机初始化更快地达成目标。
引用
@article{arxiv.1804.03758,
title = {Universal Successor Representations for Transfer Reinforcement Learning},
author = {Chen Ma and Junfeng Wen and Yoshua Bengio},
journal= {arXiv preprint arXiv:1804.03758},
year = {2018}
}