中文

MOTS:极小极大最优 Thompson 采样

机器学习 2020-10-02 v3 统计理论 机器学习 统计理论

摘要

Thompson 采样是许多在线决策问题中最广泛使用的算法之一,因其在实现上的简单性以及对其他最先进方法的优越经验性能。尽管其流行和经验成功,Thompson 采样是否能匹配 KK 臂赌博机问题的极小极大下界 Ω(KT)\Omega(\sqrt{KT})(其中 TT 为总时间范围)一直是一个未决问题。在本文中,我们通过提出一种称为 MOTS 的 Thompson 采样变体解决了这一长期开放问题,该变体在每个时间步自适应地截断所选臂的采样实例。我们证明这一简单的 Thompson 采样变体在有限时间范围 TT 下实现了极小极大最优遗憾界 O(KT)O(\sqrt{KT}),以及当 TT 趋于无穷时高斯奖励的渐近最优遗憾界。据我们所知,MOTS 是首个实现多臂赌博机问题极小极大最优性的 Thompson 采样类算法。

关键词

引用

@article{arxiv.2003.01803,
  title  = {MOTS: Minimax Optimal Thompson Sampling},
  author = {Tianyuan Jin and Pan Xu and Jieming Shi and Xiaokui Xiao and Quanquan Gu},
  journal= {arXiv preprint arXiv:2003.01803},
  year   = {2020}
}

备注

27 pages, 1 table, 2 figures. This version improves the presentation in V2