多保真度多臂老虎机
机器学习
2016-11-01 v1
摘要
我们研究经典随机臂老虎机的一个变体,其中观察每个臂的结果代价高昂,但可获得该结果的廉价近似。例如,在在线广告中,广告的效果可通过在更短时间周期内或向更窄受众展示来近似。我们将此任务形式化为多保真度老虎机,其中在每个时间步,预测者可选择以种保真度中的任意一种来拉动一个臂。最高保真度(期望结果)耗费代价。第种保真度(一种近似)耗费并返回最高保真度的有偏估计。我们提出了MF-UCB,一种用于该场景的新型上置信界过程,并证明它能自然适应可用的近似与代价序列,从而获得比忽略近似的朴素策略更低的后悔值。例如,在上述在线广告例子中,MF-UCB会利用较低保真度快速淘汰次优广告,并将代价更高的实验保留在一小组有前景的候选上。我们以一个下界补充该结果,并表明在某些条件下MF-UCB近乎最优。
引用
@article{arxiv.1610.09726,
title = {The Multi-fidelity Multi-armed Bandit},
author = {Kirthevasan Kandasamy and Gautam Dasarathy and Jeff Schneider and Barnabás Póczos},
journal= {arXiv preprint arXiv:1610.09726},
year = {2016}
}
备注
To appear at NIPS 2016