中文

高斯过程_bandit 中的宽恕后悔与优动作辨识

机器学习 2021-05-27 v2 信息论 机器学习 math.IT 最优化与控制

摘要

本文研究在放宽优化准则下的高斯过程(GP)bandit 问题,该准则规定任何高于某阈值的函数值均“足够好”。在理论方面,我们研究多种{\em 宽恕后悔}(lenient regret)概念,其中所有近最优动作均不产生惩罚,并给出 GP-UCB 与一种消除算法宽恕后悔的上界,规避了因极度逼近函数最大值而产生的通常 O(T)O(\sqrt{T}) 项(时间范围 TT)。此外,我们以算法无关下界补充这些上界。在实际方面,我们考虑依据已知预设阈值寻找单一“优动作”的问题,并引入若干利用阈值知识的优动作辨识算法。实验发现,此类算法常比标准基于优化的方法更快地找到优动作。

关键词

引用

@article{arxiv.2102.05793,
  title  = {Lenient Regret and Good-Action Identification in Gaussian Process Bandits},
  author = {Xu Cai and Selwyn Gomes and Jonathan Scarlett},
  journal= {arXiv preprint arXiv:2102.05793},
  year   = {2021}
}

备注

ICML 2021