基于对决选择_bandit_的零阶非凸优化
机器学习
2019-11-05 v1 机器学习
摘要
我们考虑一种新颖的零阶非凸优化设置,其中除了在给定点查询函数值外,我们还可以对决两个点并得到函数值较大的那个点。我们将此设置称为对决选择_bandit_优化,因为直接查询和对决都可用于优化。我们给出了基于 GP-UCB(Srinivas 等,2009)的 COMP-GP-UCB 算法,其中不直接查询具有最大上置信界(UCB)的点,而是执行约束优化并利用比较来滤除次优点。COMP-GP-UCB 在简单后悔(simple regret)上带有 的理论保证,其中 为直接查询次数, 为对应于基于比较的约束集的改进信息增益,该约束集限制了最优值的搜索空间。相比之下,在仅直接查询的设置中, 依赖于整个定义域。最后,我们给出实验结果以展示我们算法的有效性。
引用
@article{arxiv.1911.00980,
title = {Zeroth Order Non-convex optimization with Dueling-Choice Bandits},
author = {Yichong Xu and Aparna Joshi and Aarti Singh and Artur Dubrawski},
journal= {arXiv preprint arXiv:1911.00980},
year = {2019}
}
备注
19 pages, 3 figures