具有依赖臂的决斗老虎机
机器学习
2017-06-16 v2
摘要
我们研究了当臂上的偏好具有全序且带有可观测特征向量时的基于弱效用的后悔决斗老虎机问题。该顺序被假定由这些特征向量、未知偏好向量和已知效用函数决定。这种结构引入了臂对之间偏好的依赖性,并允许从一对臂的偏好中学习另一对臂的偏好。我们针对此设定提出了一种称为 Comparing The Best (CTB) 的算法,并证明其具有恒定的期望累积基于弱效用的后悔。我们提供了 CTB 的贝叶斯解释、适用于少量臂的实现,以及当输入参数满足可分解条件时可用于大量臂的另一种实现。我们通过数值实验证明,具有适当输入参数的 CTB 优于所考虑的所有基准。
引用
@article{arxiv.1605.08838,
title = {Dueling Bandits with Dependent Arms},
author = {Bangrui Chen and Peter I. Frazier},
journal= {arXiv preprint arXiv:1605.08838},
year = {2017}
}