基于贝叶斯深度Q网络的高效探索
人工智能
2019-09-10 v4 机器学习
机器学习
摘要
我们研究高维情景式马尔可夫决策过程(MDP)中的强化学习(RL)。我们考虑基于价值的RL,其中最优Q值是d维状态-动作特征表示的线性函数。例如,在深度Q网络(DQN)中,Q值是特征表示层(输出层)的线性函数。我们提出两种算法,一种基于乐观性,称为LINUCB,另一种基于后验采样,称为LINPSRL。我们为这两种算法给出了O(d sqrt{T})的频率主义与贝叶斯遗憾上界,其中T为情景数。我们将这些方法扩展到深度RL,并提出贝叶斯深度Q网络(BDQN),其使用一种高效的Thompson采样算法用于高维RL。我们采用双DQN(DDQN)方法,并且不使用线性回归学习Q网络的最后一层,而是使用贝叶斯线性回归,从而得到Q函数上的近似后验。这使我们能够直接纳入Q函数的不确定性,并在学习到的后验分布上部署Thompson采样,从而实现高效的探索/利用权衡。我们在广泛的Atari游戏上实证研究了BDQN的行为。由于BDQN进行了更高效的探索与利用,相比DDQN它能够大幅更快地获得更高的回报。
引用
@article{arxiv.1802.04412,
title = {Efficient Exploration through Bayesian Deep Q-Networks},
author = {Kamyar Azizzadenesheli and Animashree Anandkumar},
journal= {arXiv preprint arXiv:1802.04412},
year = {2019}
}