自然选项评判器
机器学习
2018-12-05 v1 人工智能
机器学习
摘要
近期提出的选项评判器架构 Bacon 等人提供了一种分层强化学习的随机策略梯度方法。具体而言,他们给出了一种估计期望折扣回报相对于定义有限数量时间扩展动作(称为选项)的参数的梯度的方法。在本文中,我们展示了如何扩展选项评判器架构以估计期望折扣回报的自然梯度。为此,我们在本文中考虑的核心问题是:1)在此背景下自然梯度的定义是什么,2)与选项的参数化策略相关的 Fisher 信息矩阵是什么,3)与选项的参数化终止函数相关的 Fisher 信息矩阵是什么,4)如何利用兼容函数逼近方法获得选项的参数化策略和参数化终止函数的自然梯度估计,且每时间步的时间和空间复杂度在参数总数上呈线性。基于这些问题的答案,我们引入了自然选项评判器算法。实验结果展示了相对于原始梯度方法的改进。
引用
@article{arxiv.1812.01488,
title = {Natural Option Critic},
author = {Saket Tiwari and Philip S. Thomas},
journal= {arXiv preprint arXiv:1812.01488},
year = {2018}
}