高斯过程_bandit 中的宽恕后悔与优动作辨识
机器学习
2021-05-27 v2 信息论
机器学习
math.IT
最优化与控制
摘要
本文研究在放宽优化准则下的高斯过程(GP)bandit 问题,该准则规定任何高于某阈值的函数值均“足够好”。在理论方面,我们研究多种{\em 宽恕后悔}(lenient regret)概念,其中所有近最优动作均不产生惩罚,并给出 GP-UCB 与一种消除算法宽恕后悔的上界,规避了因极度逼近函数最大值而产生的通常 项(时间范围 )。此外,我们以算法无关下界补充这些上界。在实际方面,我们考虑依据已知预设阈值寻找单一“优动作”的问题,并引入若干利用阈值知识的优动作辨识算法。实验发现,此类算法常比标准基于优化的方法更快地找到优动作。
引用
@article{arxiv.2102.05793,
title = {Lenient Regret and Good-Action Identification in Gaussian Process Bandits},
author = {Xu Cai and Selwyn Gomes and Jonathan Scarlett},
journal= {arXiv preprint arXiv:2102.05793},
year = {2021}
}
备注
ICML 2021