基于双不确定性值网络的高效探索
机器学习
2017-11-30 v1 人工智能
机器学习
摘要
本文通过跟踪每个可用动作价值的不确定性,研究强化学习智能体的有向探索。我们识别出与探索相关的两种不确定性来源。第一种源于有限数据(参数不确定性),第二种源于回报的分布(回报不确定性)。我们确定了用深度神经网络学习这些分布的方法,其中用贝叶斯 dropout 估计参数不确定性,而回报不确定性作为高斯分布通过 Bellman 方程传播。然后,我们确定两者可在同一网络中联合估计,我们称之为双不确定性值网络。策略基于 Thompson 采样从学习到的分布直接导出。实验结果表明,在具有强探索挑战的领域中,两类不确定性均可极大改善学习。
引用
@article{arxiv.1711.10789,
title = {Efficient exploration with Double Uncertain Value Networks},
author = {Thomas M. Moerland and Joost Broekens and Catholijn M. Jonker},
journal= {arXiv preprint arXiv:1711.10789},
year = {2017}
}
备注
Deep Reinforcement Learning Symposium @ Conference on Neural Information Processing Systems (NIPS) 2017