中文

面向非平稳在线非凸优化的多点bandit算法

机器学习 2019-09-12 v2 数据结构与算法 机器学习 最优化与控制 统计理论 统计理论

摘要

bandit算法主要在凸设定下被分析,并以基于函数值的平稳regret作为性能度量。在本文中,受在线强化学习问题的启发,我们提出并分析了针对一般与结构化非凸问题的bandit算法,以非平稳(或动态)regret作为性能度量,涵盖随机与非随机两种设定。首先,对于一般非凸函数,受离线非凸优化中类似性能度量的启发,我们考虑以一阶与二阶平稳解的非平稳版本作为regret度量。在基于二阶平稳解的regret情形下,我们提出并分析了立方正则化牛顿法(cubic regularized Newton's method)的在线与bandit版本。该bandit版本基于二阶Gaussian Stein恒等式在bandit设定下估计Hessian矩阵。我们关于二阶平稳解的非平稳regret界在bandit设定下避免鞍点方面具有有趣的结论。接下来,对于弱拟凸函数与单调弱次模函数,我们考虑基于函数值的非平稳regret度量;此类结构化的非凸函数类使得人们可以像凸函数一样考虑由函数值定义的regret度量。针对函数值以及一阶平稳解作为regret度量的这一情形,我们在若干场景下给出了低维与高维设定中的regret界。

关键词

引用

@article{arxiv.1907.13616,
  title  = {Multi-Point Bandit Algorithms for Nonstationary Online Nonconvex Optimization},
  author = {Abhishek Roy and Krishnakumar Balasubramanian and Saeed Ghadimi and Prasant Mohapatra},
  journal= {arXiv preprint arXiv:1907.13616},
  year   = {2019}
}