安全高斯过程赌博机优化的遗憾界
机器学习
2020-05-06 v1 机器学习
摘要
许多应用要求学习者在给定关于系统收益函数和安全约束的不确定性的情况下做出序贯决策。在安全攸关系统中,学习者的动作在学习过程的任何阶段都不违反安全约束是至关重要的。在本文中,我们研究一个随机赌博机优化问题,其中未知的收益和约束函数采样自高斯过程(GP),该问题首先在 [Srinivas et al., 2010] 中被考虑。我们开发了一种称为 SGP-UCB 的 GP-UCB 安全变体,并进行了必要的修改以在每一轮都遵守安全约束。该算法有两个不同的阶段。第一阶段试图估计决策集中安全动作的集合,而第二阶段遵循 GP-UCB 决策规则。我们的主要贡献是为该问题推导出了首个次线性遗憾界。我们在数值上将 SGP-UCB 与现有的安全贝叶斯 GP 优化算法进行了比较。
引用
@article{arxiv.2005.01936,
title = {Regret Bounds for Safe Gaussian Process Bandit Optimization},
author = {Sanae Amani and Mahnoosh Alizadeh and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2005.01936},
year = {2020}
}
备注
22 pages, 17 figures