中文

基于对决选择_bandit_的零阶非凸优化

机器学习 2019-11-05 v1 机器学习

摘要

我们考虑一种新颖的零阶非凸优化设置,其中除了在给定点查询函数值外,我们还可以对决两个点并得到函数值较大的那个点。我们将此设置称为对决选择_bandit_优化,因为直接查询和对决都可用于优化。我们给出了基于 GP-UCB(Srinivas 等,2009)的 COMP-GP-UCB 算法,其中不直接查询具有最大上置信界(UCB)的点,而是执行约束优化并利用比较来滤除次优点。COMP-GP-UCB 在简单后悔(simple regret)上带有 O(ΦT)O(\frac{\Phi}{\sqrt{T}}) 的理论保证,其中 TT 为直接查询次数,Φ\Phi 为对应于基于比较的约束集的改进信息增益,该约束集限制了最优值的搜索空间。相比之下,在仅直接查询的设置中,Φ\Phi 依赖于整个定义域。最后,我们给出实验结果以展示我们算法的有效性。

关键词

引用

@article{arxiv.1911.00980,
  title  = {Zeroth Order Non-convex optimization with Dueling-Choice Bandits},
  author = {Yichong Xu and Aparna Joshi and Aarti Singh and Artur Dubrawski},
  journal= {arXiv preprint arXiv:1911.00980},
  year   = {2019}
}

备注

19 pages, 3 figures