中文

强化学习中利用Gramian进行特征高效去相关

机器学习 2019-11-21 v1 人工智能 机器学习

摘要

学习良好的表示是强化学习(RL)中一个长期存在的问题。在监督设定中,实现此目标的常规方法之一是通过对参数进行正则化。将这些思想扩展到RL设定并未带来类似的学习改进。本文中,我们开发了一个用于RL中特征去相关的在线正则化框架,并在多个测试环境中展示了其效用。我们证明了所提算法在线性函数逼近设定下收敛,且不改变最大化累积奖励的主要目标。我们展示了如何利用特征的Gramian将该方法扩展到深度RL,实现关于特征数量的线性计算复杂度和关于批次大小的二次复杂度。我们在Atari 2600游戏上对新方法进行了广泛的实证研究,结果显示在49个游戏中的40个上样本效率有显著提升。

关键词

引用

@article{arxiv.1911.08610,
  title  = {Efficient decorrelation of features using Gramian in Reinforcement Learning},
  author = {Borislav Mavrin and Daniel Graves and Alan Chan},
  journal= {arXiv preprint arXiv:1911.08610},
  year   = {2019}
}