中文

岭函数赌博机凸优化的极小极大后悔界

机器学习 2021-06-08 v2 最优化与控制

摘要

我们分析了对抗性赌博机凸优化,其中对手被限制为选取形如ft(x)=gt(x,θ)f_t(x) = g_t(\langle x, \theta\rangle)的函数,这里gt:RRg_t : \mathbb R \to \mathbb R为凸函数,且未知参数θRd\theta \in \mathbb R^d随时间齐次。我们给出一个简短的信息论证明:极小极大后悔至多为O(dnlog(ndiam(K)))O(d \sqrt{n} \log(n \operatorname{diam}(\mathcal K))),其中nn为交互次数,dd为维度,diam(K)\operatorname{diam}(\mathcal K)为约束集的直径。

关键词

引用

@article{arxiv.2106.00444,
  title  = {Minimax Regret for Bandit Convex Optimisation of Ridge Functions},
  author = {Tor Lattimore},
  journal= {arXiv preprint arXiv:2106.00444},
  year   = {2021}
}

备注

Correcting an (instructive) error that leads to a weaker result