中文

核化上下文 Bandit 的有限时间分析

机器学习 2013-09-27 v1 机器学习

摘要

我们解决了在由上下文描述的大规模有限动作集上进行在线奖励最大化的问题。我们关注的情况是动作数量过大,以至于无法对所有动作甚至采样一次。然而,我们假设可以获取动作上下文之间的相似性,并且预期奖励是上下文在相关再生核希尔伯特空间 (RKHS) 中映像的任意线性函数。我们提出了 KernelUCB,一种核化的 UCB 算法,并通过频率学派分析给出了累积遗憾界。对于上下文 Bandit,相关算法 GP-UCB 被证明是我们算法的一个特例,且我们的有限时间分析在核依赖量和奖励函数的 RKHS 范数方面,改进了 GP-UCB 在非知情情况下的遗憾界。此外,对于线性核,我们的遗憾界与上下文线性 Bandit 的下界相匹配。

关键词

引用

@article{arxiv.1309.6869,
  title  = {Finite-Time Analysis of Kernelised Contextual Bandits},
  author = {Michal Valko and Nathaniel Korda and Remi Munos and Ilias Flaounas and Nelo Cristianini},
  journal= {arXiv preprint arXiv:1309.6869},
  year   = {2013}
}

备注

Appears in Proceedings of the Twenty-Ninth Conference on Uncertainty in Artificial Intelligence (UAI2013)