Bandit 设定下鲁棒黑盒优化的情景方法
最优化与控制
2018-05-01 v1
摘要
本文讨论了一种在 bandit 设定下对黑盒函数进行鲁棒优化的情景方法。我们假设黑盒函数对于不确定参数的每一次实现都可以建模为高斯过程(GP)。我们采用一种情景方法,其中我们抽取不确定参数的固定独立样本。对于给定的策略,即采样集中查询点与不确定参数的一段序列,我们引入一个相对于不确定参数的额外抽取所定义的遗憾概念,称为重抽情景遗憾。我们提出一种基于情景的迭代算法,利用固定独立情景的上置信界(UCB)来计算黑盒优化的策略。对于该算法,我们刻画了算法任意有限次迭代下重抽遗憾的高概率上界。我们进一步刻画了在若干参数区间内,该遗憾随迭代次数以高概率渐近趋于零。最后,我们用数值结果补充了我们的分析。
引用
@article{arxiv.1804.10932,
title = {Scenario Approach for Robust Blackbox Optimization in the Bandit Setting},
author = {Shaunak D. Bopardikar and Vaibhav Srivastava},
journal= {arXiv preprint arXiv:1804.10932},
year = {2018}
}