中文

带度量移动代价的多臂老虎机

机器学习 2017-10-26 v1

摘要

我们考虑非随机多臂老虎机问题,其设定中动作空间上存在一个固定且已知的度量,该度量决定了任意一对动作之间切换的代价。在线学习者的损失由两部分组成:第一部分是所选动作的通常损失,第二部分是因动作切换而产生的额外损失。我们的主要贡献利用底层度量的一个复杂度为 C\mathcal{C} 的度量(依赖于其覆盖数)对该设定下的期望极大极小遗憾给出了紧表征。在具有 kk 个动作的有限度量空间中,我们给出了一个高效算法,实现了 O~(max{C1/3T2/3,kT})\widetilde{O}(\max\{\mathcal{C}^{1/3}T^{2/3},\sqrt{kT}\}) 形式的遗憾,并证明这是可能的最佳结果。我们的遗憾界推广了某些特殊情形的已知遗憾界:(i) 单位切换代价遗憾 Θ~(max{k1/3T2/3,kT})\widetilde{\Theta}(\max\{k^{1/3}T^{2/3},\sqrt{kT}\}),其中 C=Θ(k)\mathcal{C}=\Theta(k);(ii) 区间度量,其遗憾为 Θ~(max{T2/3,kT})\widetilde{\Theta}(\max\{T^{2/3},\sqrt{kT}\}),其中 C=Θ(1)\mathcal{C}=\Theta(1)。对于具有 Lipschitz 损失函数的无限度量空间,我们推导了 Θ~(Td+1d+2)\widetilde{\Theta}(T^{\frac{d+1}{d+2}}) 的紧遗憾界,其中 d1d \ge 1 为空间的 Minkowski 维数,已知该界即使在无切换代价时也是紧的。

关键词

引用

@article{arxiv.1710.08997,
  title  = {Multi-Armed Bandits with Metric Movement Costs},
  author = {Tomer Koren and Roi Livni and Yishay Mansour},
  journal= {arXiv preprint arXiv:1710.08997},
  year   = {2017}
}