中文

摊销变分深度 Q 网络

机器学习 2020-11-04 v1 人工智能 机器学习

摘要

高效探索是深度强化学习中最重要的问题之一。为解决该问题,近期方法将价值函数参数视为随机变量,并借助变分推断来近似参数的后验。本文提出一种摊销变分推断框架,以近似深度 Q 网络中动作价值函数的后验分布。我们建立了新模型损失与摊销变分推断损失之间的等价性。通过在两阶段训练过程中分别假设后验为柯西分布和高斯分布,实现了探索与利用的平衡。我们表明该摊销框架可比现有最先进方法显著减少学习参数。在 OpenAI Gym 中的经典控制任务以及链式马尔可夫决策过程任务上的实验结果表明,所提方法显著优于最先进方法,且所需训练时间少得多。

关键词

引用

@article{arxiv.2011.01706,
  title  = {Amortized Variational Deep Q Network},
  author = {Haotian Zhang and Yuhao Wang and Jianyong Sun and Zongben Xu},
  journal= {arXiv preprint arXiv:2011.01706},
  year   = {2020}
}

备注

Accepted to appear in the Deep Reinforcement Learning Workshop at NeurIPS 2020