中文

马尔可夫决策过程中的时间正则化

机器学习 2019-04-12 v2 机器学习

摘要

强化学习的若干应用因高方差而不稳定,在高维领域尤为突出。正则化是机器学习中常用的以引入一定偏差为代价降低方差的技术。现有正则化技术多关注空间(感知)正则化。然而在强化学习中,由于Bellman方程的性质,还存在利用轨迹上价值估计平滑性进行时间正则化的机会。本文探讨一类时间正则化方法,利用马尔可夫链概念形式化刻画该技术引入的偏差,并通过一系列简单离散与连续MDP阐明时间正则化的各种特性,表明该方法即便在高维Atari游戏中也能带来改进。

关键词

引用

@article{arxiv.1811.00429,
  title  = {Temporal Regularization in Markov Decision Process},
  author = {Pierre Thodoroff and Audrey Durand and Joelle Pineau and Doina Precup},
  journal= {arXiv preprint arXiv:1811.00429},
  year   = {2019}
}

备注

Published as a conference paper at NIPS 2018