中文

关于高斯过程bandit中的信息增益与后悔界

机器学习 2021-03-11 v3 信息论 机器学习 math.IT

摘要

考虑从含噪反馈中序贯优化一个评估代价高昂且可能非凸的目标函数 ff,这可视为连续臂bandit问题。在贝叶斯(当 ff 为高斯过程(Gaussian Process, GP)的样本)与频率派(当 ff 位于再生核希尔伯特空间)两种设定下,若干学习算法(GP-UCB、GP-TS 及其变体)的后悔性能上界均已为人所知。后悔界常依赖于 TT 次观测与底层 GP(代理)模型之间的最大信息增益 γT\gamma_T。我们基于 GP 核特征值的衰减速率给出了 γT\gamma_T 的一般界;将其用于常用核时,改进了现有的 γT\gamma_T 界,进而改进了众多设定下依赖于 γT\gamma_T 的后悔界。对于 Matérn 核族,在频率派设定下 γT\gamma_T 与后悔的下界已知,我们的结果填补了上界与下界之间高达 TT 的多项式量级差距(除对数因子外)。

关键词

引用

@article{arxiv.2009.06966,
  title  = {On Information Gain and Regret Bounds in Gaussian Process Bandits},
  author = {Sattar Vakili and Kia Khezeli and Victor Picheny},
  journal= {arXiv preprint arXiv:2009.06966},
  year   = {2021}
}