用于加速全局优化的梯度与 Bandit 学习的贝叶斯统一
人工智能
2017-05-30 v1 机器学习
摘要
基于 Bandit 的优化因其全局视角而优于基于梯度的方法,避免了陷入局部最优的风险。然而,对于连续优化问题或具有大量动作的问题,基于 Bandit 的方法可能受限于缓慢的学习速度。另一方面,基于梯度的方法通过局部优化,以细粒度的步长跟随梯度,能在高维连续空间中快速导航。但是,除了容易陷入局部最优外,这些方案由于在确定最优解之前依赖大量的试错,因此不太适合在线学习。在本文中,我们提出了一种贝叶斯方法,将上述两种范式统一在单一框架中,旨在结合两者的优势。我们方法的核心是对待优化函数进行随机线性近似,其中明确捕获了函数的梯度和值。这使我们能够从含噪的函数和梯度观测中学习,并在整个动作空间中预测这些属性以支持优化。我们进一步提出了一种伴随的 Bandit 驱动的探索方案,该方案使用贝叶斯可信区间来权衡探索与利用。我们的实证结果表明,通过统一 Bandit 和基于梯度的学习,可以在广泛的问题环境中获得持续改善的性能。此外,即使在没有梯度反馈的情况下,我们模型的灵活性(包括梯度预测)仍然使我们能够胜过竞争方法,尽管优势较小。由于基于 Bandit 的优化无处不在,我们的方案在元优化以及容易获得梯度相关信息的应用中都开辟了提升性能的途径。
引用
@article{arxiv.1705.09922,
title = {Bayesian Unification of Gradient and Bandit-based Learning for Accelerated Global Optimisation},
author = {Ole-Christoffer Granmo},
journal= {arXiv preprint arXiv:1705.09922},
year = {2017}
}
备注
15th IEEE International Conference on Machine Learning and Applications (ICMLA 2016)