过程即回报:有影响力轨迹的无监督学习
机器学习
2019-05-24 v1 人工智能
机器学习
摘要
在多样且稀疏的环境中学习时,无监督探索与表示学习变得愈发重要。赋能的信息论原理通过一个试图最大化其对环境未来状态影响的智能体,形式化了无监督探索目标。以往方法存在一定局限:要么未采用闭环反馈,要么不具有内部状态。因此,一个特权最终状态被用作影响度量,而非完整轨迹。我们提供了一种无模型方法,其考虑整个轨迹,同时仍具备基于选项的方法的优势。我们成功地将我们的方法应用于具有大动作空间的环境,其中有意义动作序列的发现尤为困难。
引用
@article{arxiv.1905.09334,
title = {The Journey is the Reward: Unsupervised Learning of Influential Trajectories},
author = {Jonathan Binas and Sherjil Ozair and Yoshua Bengio},
journal= {arXiv preprint arXiv:1905.09334},
year = {2019}
}
备注
ICML'19 ERL Workshop