基于变分内在后继特征的快速任务推断
机器学习
2020-01-28 v2 人工智能
机器学习
摘要
已有研究表明,通过奖励策略以使其区别于其他策略,可以训练出跨越马尔可夫决策过程可控子空间的多样化行为 \citep{gregor2016variational, eysenbach2018diversity, warde2018unsupervised}。然而,该表述的一个局限在于将行为泛化到显式学习的有限集合之外,而这正是后续任务使用所需要的。后继特征 \citep{dayan93improving, barreto2017successor} 为这一泛化问题提供了诱人的解决方案,但要求将奖励函数定义为某个基础特征空间中的线性函数。在本文中,我们展示了这两种技术可以结合,并且每种方法都解决了另一种方法的主要局限。为此,我们引入了变分内在后继特征(Variational Intrinsic Successor FeatuRes,VISR),一种新颖的算法,它学习可控特征,可通过后继特征框架加以利用,以提供增强的泛化和快速任务推断。我们在完整的 Atari 套件上实证验证了 VISR,在一个新颖的设置中,奖励仅在漫长的无监督阶段之后短暂暴露。VISR 在 14 个游戏上达到人类水平表现并击败所有基线,我们相信它代表了朝能从有限反馈中快速学习的智能体迈出的一步。
引用
@article{arxiv.1906.05030,
title = {Fast Task Inference with Variational Intrinsic Successor Features},
author = {Steven Hansen and Will Dabney and Andre Barreto and Tom Van de Wiele and David Warde-Farley and Volodymyr Mnih},
journal= {arXiv preprint arXiv:1906.05030},
year = {2020}
}
备注
Accepted for publication at ICLR 2020