中文

深度贝叶斯 Bandit 对决:用于 Thompson 采样的贝叶斯深度网络实证比较

机器学习 2018-02-27 v1 机器学习

摘要

深度强化学习的最新进展在围棋和 Atari 游戏等应用上取得了显著性能提升。然而,在复杂领域中开发平衡探索与利用的实用方法在很大程度上仍未解决。Thompson 采样及其对强化学习的扩展提供了一种优雅的探索方法,仅需访问模型的后验样本。同时,近似贝叶斯方法的进展使得灵活神经网络模型的后验近似变得实用。因此,在 Thompson 采样框架中考虑近似贝叶斯神经网络颇具吸引力。为理解使用近似后验对 Thompson 采样的影响,我们在一组上下文 bandit 问题上,对结合 Thompson 采样的既有及近期开发的近似后验采样方法进行了基准测试。我们发现许多在监督学习设定中成功的方法在序贯决策场景中表现不佳。特别地,我们强调了将缓慢收敛的不确定性估计适应到在线设定这一挑战。

关键词

引用

@article{arxiv.1802.09127,
  title  = {Deep Bayesian Bandits Showdown: An Empirical Comparison of Bayesian Deep Networks for Thompson Sampling},
  author = {Carlos Riquelme and George Tucker and Jasper Snoek},
  journal= {arXiv preprint arXiv:1802.09127},
  year   = {2018}
}

备注

Sixth International Conference on Learning Representations, ICLR 2018