用于迁移强化学习的通用后继特征
机器学习
2020-01-14 v1 人工智能
机器学习
摘要
强化学习(RL)中的迁移指的是将先前任务中获得的知识应用于解决相关任务的思路。学习通用值函数(Schaul 等,2015),其对目标和状态进行泛化,先前已被证明对迁移有用。然而,后继特征被认为比值函数更适合迁移(Dayan,1993;Barreto 等,2017),尽管它们不能直接泛化到新目标。本文中,我们提出(1)通用后继特征(USFs)以捕捉环境底层动态,同时允许对未见目标泛化;(2)一个灵活的端到端 USF 模型,可通过与环境交互进行训练。我们表明学习 USFs 与任何使用时序差分方法学习状态值的 RL 算法兼容。我们在简单网格世界和两个 MuJoCo 环境中的实验表明,USFs 在学习多个任务时可大幅加速训练,并能有效将知识迁移到新任务。
引用
@article{arxiv.2001.04025,
title = {Universal Successor Features for Transfer Reinforcement Learning},
author = {Chen Ma and Dylan R. Ashley and Junfeng Wen and Yoshua Bengio},
journal= {arXiv preprint arXiv:2001.04025},
year = {2020}
}