基于乘性归一化流的随机化值函数
机器学习
2019-07-02 v3 机器学习
摘要
随机化值函数为解决具有高维状态和动作空间的复杂环境中的高效探索挑战提供了一种有前景的方法。与传统的点估计方法不同,随机化值函数在动作空间值上维持一个后验分布。这防止了智能体的行为策略过早利用早期估计并陷入局部最优。在本工作中,我们利用变分贝叶斯神经网络的最新进展,并将其与传统 Deep Q-Networks (DQN) 和 Deep Deterministic Policy Gradient (DDPG) 相结合,以实现高维领域的随机化值函数。具体而言,我们用乘性归一化流增强 DQN 和 DDPG,以跟踪值函数参数上的丰富近似后验分布。这使得智能体能够通过随机梯度方法以计算高效的方式执行近似 Thompson 采样。我们通过在高维环境中的经验比较展示了我们方法的优势。
引用
@article{arxiv.1806.02315,
title = {Randomized Value Functions via Multiplicative Normalizing Flows},
author = {Ahmed Touati and Harsh Satija and Joshua Romoff and Joelle Pineau and Pascal Vincent},
journal= {arXiv preprint arXiv:1806.02315},
year = {2019}
}