强化学习中利用Gramian进行特征高效去相关
机器学习
2019-11-21 v1 人工智能
机器学习
摘要
学习良好的表示是强化学习(RL)中一个长期存在的问题。在监督设定中,实现此目标的常规方法之一是通过对参数进行正则化。将这些思想扩展到RL设定并未带来类似的学习改进。本文中,我们开发了一个用于RL中特征去相关的在线正则化框架,并在多个测试环境中展示了其效用。我们证明了所提算法在线性函数逼近设定下收敛,且不改变最大化累积奖励的主要目标。我们展示了如何利用特征的Gramian将该方法扩展到深度RL,实现关于特征数量的线性计算复杂度和关于批次大小的二次复杂度。我们在Atari 2600游戏上对新方法进行了广泛的实证研究,结果显示在49个游戏中的40个上样本效率有显著提升。
引用
@article{arxiv.1911.08610,
title = {Efficient decorrelation of features using Gramian in Reinforcement Learning},
author = {Borislav Mavrin and Daniel Graves and Alan Chan},
journal= {arXiv preprint arXiv:1911.08610},
year = {2019}
}