中文

Bandit 凸优化的在线 Newton 方法

最优化与控制 2024-06-11 v1 机器学习 机器学习

摘要

我们提出了一个高效的零阶 bandit 凸优化算法,证明其在对抗性情形下的 regret 最多为 d3.5npolylog(n,d)d^{3.5} \sqrt{n} \mathrm{polylog}(n, d)(其中 dd 为维数,nn 为时间范围),且以高概率实现。在随机情形下,该界限改进为 Md2npolylog(n,d)M d^{2} \sqrt{n} \mathrm{polylog}(n, d),其中 M[d1/2,d1/4]M \in [d^{-1/2}, d^{-1 / 4}] 为取决于约束集几何和所需计算属性的常数。

关键词

引用

@article{arxiv.2406.06506,
  title  = {Online Newton Method for Bandit Convex Optimisation},
  author = {Hidde Fokkema and Dirk van der Hoeven and Tor Lattimore and Jack J. Mayo},
  journal= {arXiv preprint arXiv:2406.06506},
  year   = {2024}
}