基于信息阈值的高斯过程_bandits_中遗憾与后验复杂度的权衡
机器学习
2022-03-24 v3 信息论
math.IT
机器学习
摘要
贝叶斯优化是一种通过最大后验更新而非模拟退火进行全局搜索的框架,因其在不确定性下的决策能力而受到重视。在本工作中,我们将贝叶斯优化视为一个多臂_bandit问题,其中收益函数从高斯过程(GP)中采样。此外,我们关注通过上置信界(UCB)或期望改进(EI)进行动作选择,因为它们在实践中被广泛使用。先前使用GP处理_bandits的工作无法允许迭代步数过大,因为计算后验参数的复杂度随过去观测数量呈三次方增长。为规避这一计算负担,我们提出了一种简单的统计检验:仅当某动作的条件熵超过阈值时,才将其纳入GP后验。如此一来,我们得以精确刻画GP_bandit算法的遗憾界与后验分布复杂度之间的权衡,该权衡取决于离散和连续动作集下压缩参数。据我们所知,这是首个在保持后验复杂度亚线性增长率(现有文献中为线性)的同时获得亚线性遗憾界的结果。此外,可获得可证明有限的复杂度界,但算法会导致-遗憾,即意味着当时。在实验上,我们观察到应用于全局优化的GP_bandit算法具有最先进的精度与复杂度权衡,表明压缩GP在_bandit设置中的优势。
引用
@article{arxiv.2003.10550,
title = {Regret and Belief Complexity Trade-off in Gaussian Process Bandits via Information Thresholding},
author = {Amrit Singh Bedi and Dheeraj Peddireddy and Vaneet Aggarwal and Brian M. Sadler and Alec Koppel},
journal= {arXiv preprint arXiv:2003.10550},
year = {2022}
}