廉价Bandits
机器学习
2015-06-22 v2
摘要
我们考虑随机序列学习问题,其中学习者可以观测若干动作的平均奖励。此类设定在许多涉及监控与监视的应用中令人关注,其中待观测动作的集合代表某个(地理)区域。该设定的重要性在于,在这些应用中,观测一组动作的平均奖励实际上比观测单个动作的奖励更廉价。我们表明,当奖励在表示相邻动作的给定图上平滑时,我们可以在最小化感知成本的同时最大化学习的累积奖励。本文提出 CheapUCB,一种算法,它匹配该设定下已知算法的后悔保证,同时相对于它们保证线性成本。作为我们分析的一个副产品,我们建立了一类具有有效维度 的图上谱 bandits 累积后悔的 下界。
引用
@article{arxiv.1506.04782,
title = {Cheap Bandits},
author = {Manjesh Kumar Hanawal and Venkatesh Saligrama and Michal Valko and R\' emi Munos},
journal= {arXiv preprint arXiv:1506.04782},
year = {2015}
}
备注
To be presented at ICML 2015