中文

信息导向采样与异方差噪声下的Bandit问题

机器学习 2018-04-20 v2

摘要

在随机bandit问题中,目标是通过一系列含噪评估来最大化一个未知函数。通常假设观测噪声与评估点无关,且在整个定义域上一致满足尾界;这对许多应用而言是一个限制性假设。在本工作中,我们考虑具有异方差噪声的bandit,其中我们明确允许噪声分布依赖于评估点。我们表明这导致了信息与后悔之间的新权衡,而现有方法如置信上界算法(UCB)或Thompson Sampling并未考虑这些权衡。为解决这些不足,我们引入了一个频率派后悔分析框架,该框架类似于Russo和Van Roy(2014)的贝叶斯框架,并证明了针对一般(可能是随机的)策略的一个新的高概率后悔界,该界依赖于我们称之为后悔-信息比的量。由此界出发,我们定义了信息导向采样(IDS)的频率派版本,以在所有可能的动作采样分布上最小化后悔-信息比。这进一步依赖于可分Hilbert空间中在线最小二乘回归的集中不等式,我们将其推广到异方差噪声的情形。然后我们针对线性和再生核Hilbert空间响应函数给出了IDS的若干变体,从而得到用于贝叶斯优化的新算法。我们还证明了频率派后悔界,在同方差情形下可恢复UCB的已知界,但在异方差噪声时可能好得多。在实验中,我们在异方差噪声的线性设定下证明,我们的一些方法可以优于UCB和Thompson Sampling,同时在同方差噪声时保持竞争力。

关键词

引用

@article{arxiv.1801.09667,
  title  = {Information Directed Sampling and Bandits with Heteroscedastic Noise},
  author = {Johannes Kirschner and Andreas Krause},
  journal= {arXiv preprint arXiv:1801.09667},
  year   = {2018}
}

备注

Figure 1a,2a updated