中文

对决多臂老虎机的双重 Thompson 采样

机器学习 2016-10-28 v2 机器学习

摘要

本文针对对决多臂老虎机问题提出了一种双重 Thompson 采样(D-TS)算法。顾名思义,D-TS 根据 Thompson 采样同时选择第一和第二个候选。具体而言,D-TS 维护偏好矩阵的后验分布,并通过从后验分布中采样两次来选择用于比较的臂对。这一简单算法适用于一般的 Copeland 对决老虎机,其中包括 Condorcet 对决老虎机作为其特例。对于一般的 Copeland 对决老虎机,我们证明 D-TS 达到 O(K2logT)O(K^2 \log T) 后悔界。对于 Condorcet 对决老虎机,我们进一步简化 D-TS 算法,并证明简化后的 D-TS 算法达到 O(KlogT+K2loglogT)O(K \log T + K^2 \log \log T) 后悔界。基于合成和真实世界数据的仿真结果证明了所提出的 D-TS 算法的有效性。

关键词

引用

@article{arxiv.1604.07101,
  title  = {Double Thompson Sampling for Dueling Bandits},
  author = {Huasen Wu and Xin Liu},
  journal= {arXiv preprint arXiv:1604.07101},
  year   = {2016}
}

备注

27 pages, 5 figures, 9 tables; accepted by 30th Conference on Neural Information Processing Systems (NIPS), 2016