带预算约束的多臂多播放_bandit 问题
机器学习
2017-11-17 v1 人工智能
机器学习
摘要
我们研究了在随机和对抗两种设定下带预算约束且多播放的多臂_bandit 问题。在每一轮,必须从 N 个可能臂中恰好播放 K 个(1≤K≤N)。除了观测每个被播放臂的个体奖励外,玩家还学习一个成本向量,该向量必须由先验定义的预算 B 覆盖。当与被播放臂相关的当前成本之和超过剩余预算时,游戏结束。首先,我们分析了随机情形,其中假设每个臂具有支撑分别为 [c_min, 1] 和 [0, 1] 的潜在成本与奖励分布。我们推导出一种达到 O(NK^4 log B) 后悔界的上置信界(UCB)算法。其次,对于整个奖励与成本序列预先固定的对抗情形,我们利用著名的 Exp3 算法的扩展推导了 O(√(NB log(N/K))) 阶后悔的上界。我们还提供了以高概率成立的上界以及 Ω((1 - K/N)^2 √(NB/K)) 阶的下界。
引用
@article{arxiv.1711.05928,
title = {Budget-Constrained Multi-Armed Bandits with Multiple Plays},
author = {Datong P. Zhou and Claire J. Tomlin},
journal= {arXiv preprint arXiv:1711.05928},
year = {2017}
}
备注
20 pages