带度量移动代价的多臂老虎机
机器学习
2017-10-26 v1
摘要
我们考虑非随机多臂老虎机问题,其设定中动作空间上存在一个固定且已知的度量,该度量决定了任意一对动作之间切换的代价。在线学习者的损失由两部分组成:第一部分是所选动作的通常损失,第二部分是因动作切换而产生的额外损失。我们的主要贡献利用底层度量的一个复杂度为 的度量(依赖于其覆盖数)对该设定下的期望极大极小遗憾给出了紧表征。在具有 个动作的有限度量空间中,我们给出了一个高效算法,实现了 形式的遗憾,并证明这是可能的最佳结果。我们的遗憾界推广了某些特殊情形的已知遗憾界:(i) 单位切换代价遗憾 ,其中 ;(ii) 区间度量,其遗憾为 ,其中 。对于具有 Lipschitz 损失函数的无限度量空间,我们推导了 的紧遗憾界,其中 为空间的 Minkowski 维数,已知该界即使在无切换代价时也是紧的。
引用
@article{arxiv.1710.08997,
title = {Multi-Armed Bandits with Metric Movement Costs},
author = {Tomer Koren and Roi Livni and Yishay Mansour},
journal= {arXiv preprint arXiv:1710.08997},
year = {2017}
}