中文

廉价Bandits

机器学习 2015-06-22 v2

摘要

我们考虑随机序列学习问题,其中学习者可以观测若干动作的平均奖励。此类设定在许多涉及监控与监视的应用中令人关注,其中待观测动作的集合代表某个(地理)区域。该设定的重要性在于,在这些应用中,观测一组动作的平均奖励实际上比观测单个动作的奖励更廉价。我们表明,当奖励在表示相邻动作的给定图上平滑时,我们可以在最小化感知成本的同时最大化学习的累积奖励。本文提出 CheapUCB,一种算法,它匹配该设定下已知算法的后悔保证,同时相对于它们保证线性成本。作为我们分析的一个副产品,我们建立了一类具有有效维度 dd 的图上谱 bandits 累积后悔的 Ω(dT)\Omega(\sqrt{dT}) 下界。

关键词

引用

@article{arxiv.1506.04782,
  title  = {Cheap Bandits},
  author = {Manjesh Kumar Hanawal and Venkatesh Saligrama and Michal Valko and R\' emi Munos},
  journal= {arXiv preprint arXiv:1506.04782},
  year   = {2015}
}

备注

To be presented at ICML 2015