中文

基于双不确定性值网络的高效探索

机器学习 2017-11-30 v1 人工智能 机器学习

摘要

本文通过跟踪每个可用动作价值的不确定性,研究强化学习智能体的有向探索。我们识别出与探索相关的两种不确定性来源。第一种源于有限数据(参数不确定性),第二种源于回报的分布(回报不确定性)。我们确定了用深度神经网络学习这些分布的方法,其中用贝叶斯 dropout 估计参数不确定性,而回报不确定性作为高斯分布通过 Bellman 方程传播。然后,我们确定两者可在同一网络中联合估计,我们称之为双不确定性值网络。策略基于 Thompson 采样从学习到的分布直接导出。实验结果表明,在具有强探索挑战的领域中,两类不确定性均可极大改善学习。

关键词

引用

@article{arxiv.1711.10789,
  title  = {Efficient exploration with Double Uncertain Value Networks},
  author = {Thomas M. Moerland and Joost Broekens and Catholijn M. Jonker},
  journal= {arXiv preprint arXiv:1711.10789},
  year   = {2017}
}

备注

Deep Reinforcement Learning Symposium @ Conference on Neural Information Processing Systems (NIPS) 2017