成本约束下渐近最优的多臂老虎机策略
机器学习
2015-12-18 v3 最优化与控制
摘要
我们针对带有成本约束的多臂老虎机(MAB)问题开发了渐近最优策略。该模型适用于这样的情况:从总体(老虎机)中每次抽样(或激活)会产生已知的依赖于老虎机的成本。来自每个总体的连续抽样是独立同分布的随机变量,具有未知分布。目标是设计一种可行策略,以决定从哪个总体抽样,从而最大化n次总抽样的期望结果之和,或等效地最小化因缺乏抽样分布信息而产生的后悔值。对于此问题,我们考虑满足样本路径意义上成本约束的可行一致快速(f-UF)收敛策略类。我们首先建立了f-UF策略后悔函数增长率的必要渐近下界。然后我们构造了一类f-UF策略,并给出了它们在f-UF策略类中渐近最优、达到该渐近下界的条件。最后,针对未知分布为均值未知、方差已知的Normal分布的情况,我们给出了此类策略的显式形式。
引用
@article{arxiv.1509.02857,
title = {Asymptotically Optimal Multi-Armed Bandit Policies under a Cost Constraint},
author = {Apostolos N. Burnetas and Odysseas Kanavetas and Michael N. Katehakis},
journal= {arXiv preprint arXiv:1509.02857},
year = {2015}
}