中文

基于核方法的赌博机凸优化

机器学习 2016-07-19 v1 数据结构与算法 最优化与控制 机器学习

摘要

我们考虑对抗性凸赌博机问题,并针对该问题构建了首个 poly(T)\mathrm{poly}(T)-时间算法,其悔值为 poly(n)T\mathrm{poly}(n) \sqrt{T}。为此,我们在无导数优化文献中引入了三个新思路:(i) 核方法,(ii) 伯努利卷积的推广,以及 (iii) 指数权重的一种新退火调度(具有递增学习率)。我们算法的基础版本达到了 O~(n9.5T)\tilde{O}(n^{9.5} \sqrt{T})-悔值,并且我们表明该算法的一个简单变体可以每步以 poly(nlog(T))\mathrm{poly}(n \log(T))-时间运行,代价是悔值中额外乘以 poly(n)To(1)\mathrm{poly}(n) T^{o(1)} 因子。这些结果改进了前两位作者的 O~(n11T)\tilde{O}(n^{11} \sqrt{T})-悔值和 exp(poly(T))\exp(\mathrm{poly}(T))-时间的结果,以及 Hazan 和 Li 的 log(T)poly(n)T\log(T)^{\mathrm{poly}(n)} \sqrt{T}-悔值和 log(T)poly(n)\log(T)^{\mathrm{poly}(n)}-时间的结果。此外,我们猜想该算法的另一个变体可以达到 O~(n1.5T)\tilde{O}(n^{1.5} \sqrt{T})-悔值,并且该悔值无法进一步改进(当前最佳下界为 Ω(nT)\Omega(n \sqrt{T}),且由线性函数达到)。对于更简单的零阶随机凸优化情形,这对应于最优查询复杂度为 n3/ϵ2n^3 / \epsilon^2 量级的猜想。

关键词

引用

@article{arxiv.1607.03084,
  title  = {Kernel-based methods for bandit convex optimization},
  author = {Sébastien Bubeck and Ronen Eldan and Yin Tat Lee},
  journal= {arXiv preprint arXiv:1607.03084},
  year   = {2016}
}

备注

45 pages