中文

多保真度多臂老虎机

机器学习 2016-11-01 v1

摘要

我们研究经典随机KK臂老虎机的一个变体,其中观察每个臂的结果代价高昂,但可获得该结果的廉价近似。例如,在在线广告中,广告的效果可通过在更短时间周期内或向更窄受众展示来近似。我们将此任务形式化为多保真度老虎机,其中在每个时间步,预测者可选择以MM种保真度中的任意一种来拉动一个臂。最高保真度(期望结果)耗费代价λ(m)\lambda^{(m)}。第mm种保真度(一种近似)耗费λ(m)<λ(M)\lambda^{(m)} < \lambda^{(M)}并返回最高保真度的有偏估计。我们提出了MF-UCB,一种用于该场景的新型上置信界过程,并证明它能自然适应可用的近似与代价序列,从而获得比忽略近似的朴素策略更低的后悔值。例如,在上述在线广告例子中,MF-UCB会利用较低保真度快速淘汰次优广告,并将代价更高的实验保留在一小组有前景的候选上。我们以一个下界补充该结果,并表明在某些条件下MF-UCB近乎最优。

关键词

引用

@article{arxiv.1610.09726,
  title  = {The Multi-fidelity Multi-armed Bandit},
  author = {Kirthevasan Kandasamy and Gautam Dasarathy and Jeff Schneider and Barnabás Póczos},
  journal= {arXiv preprint arXiv:1610.09726},
  year   = {2016}
}

备注

To appear at NIPS 2016