中文

随机上下文对决多臂老虎机中的后悔最小化

机器学习 2021-05-11 v2 机器学习

摘要

我们考虑上下文设定下的随机 KK-臂对决老虎机问题,其中每轮学习者被呈现一个包含 KK 个物品的上下文集合,每个物品由一个 dd 维特征向量表示,学习者的目标是识别每个上下文集合中的最优臂。然而,与经典上下文老虎机设定不同,我们的框架仅允许学习者以(含噪的)成对偏好形式接收物品反馈——作为对决老虎机被广泛研究,在各类在线决策场景中具有实际意义,例如推荐系统、信息检索、锦标赛排序,其中更容易获知物品的相对强弱而非其绝对分数。然而,据我们所知,本工作是首个考虑潜在无限决策空间的上下文对决老虎机的后悔最小化问题,并给出了可证明最优的算法以及匹配的下界分析。我们针对该设定提出了两种算法,其各自的后悔保证为 O~(dT)\tilde O(d\sqrt{T})O~(dTlogK)\tilde O(\sqrt{dT \log K})。随后我们还证明了 Ω(dT)\Omega(\sqrt {dT}) 实际上是该问题的根本性能极限,意味着我们第二种算法的最优性。不过我们第一种算法的分析相对更简单,且经验上常表现为优于前者。最后,我们用合适的实验证实了所有理论结果。

关键词

引用

@article{arxiv.2002.08583,
  title  = {Regret Minimization in Stochastic Contextual Dueling Bandits},
  author = {Aadirupa Saha and Aditya Gopalan},
  journal= {arXiv preprint arXiv:2002.08583},
  year   = {2021}
}

备注

Wrong result with incremental contribution, major revision required