中文

UCB Momentum Q-learning:在不忘却的前提下纠正偏差

机器学习 2022-03-21 v2 机器学习

摘要

我们提出 UCBMQ(Upper Confidence Bound Momentum Q-learning,上置信界动量 Q-learning),一种用于表格型且可能阶段依赖的分幕马尔可夫决策过程强化学习的新算法。UCBMQ 基于 Q-learning,我们加入了一个动量项,并依靠面对不确定性时的乐观原则来处理探索。UCBMQ 的新技术要素是利用动量来纠正 Q-learning 所遭受的偏差,同时限制其对后悔二阶项的影响。对于 UCBMQ,我们能够保证至多 O(H3SAT+H4SA)O(\sqrt{H^3SAT}+ H^4 S A ) 的后悔界,其中 HH 为一幕的长度,SS 为状态数,AA 为动作数,TT 为幕数,并忽略 poly-log(SAHT)\log(SAHT) 项。值得注意的是,UCBMQ 是首个同时匹配足够大 TTΩ(H3SAT)\Omega(\sqrt{H^3SAT}) 下界,且二阶项(相对于时域 TT)仅随状态数 SS 线性缩放的算法。

关键词

引用

@article{arxiv.2103.01312,
  title  = {UCB Momentum Q-learning: Correcting the bias without forgetting},
  author = {Pierre Menard and Omar Darwiche Domingues and Xuedong Shang and Michal Valko},
  journal= {arXiv preprint arXiv:2103.01312},
  year   = {2022}
}