可解析处理的贝叶斯深度 Q-学习
机器学习
2021-06-22 v1 机器学习
摘要
自深度 Q-学习 (DQN) 被证明能在视频游戏基准上达到人类水平以来,强化学习 (RL) 获得了越来越多的关注。当前在此类复杂环境中训练神经网络的共识是依赖基于梯度的优化。尽管存在替代的贝叶斯深度学习方法,其中大多数仍依赖基于梯度的优化,且通常无法在如 Atari 游戏环境等基准上扩展。此外,这些方法均无法对定义神经网络的权重和偏置进行解析推断。本文中,我们展示了如何调整时序差分 Q-学习框架以使其与可处理近似高斯推断 (TAGI) 兼容,从而使用闭式解析方法学习神经网络参数。通过采用同策略和离策略强化学习方法的实验,我们证明 TAGI 能在超参数更少且不依赖基于梯度优化的情况下,达到与反向传播训练网络相当的性能。
引用
@article{arxiv.2106.11086,
title = {Analytically Tractable Bayesian Deep Q-Learning},
author = {Luong Ha and Nguyen and James-A. Goulet},
journal= {arXiv preprint arXiv:2106.11086},
year = {2021}
}
备注
19 pages, 4 figures