MOTS:极小极大最优 Thompson 采样
机器学习
2020-10-02 v3 统计理论
机器学习
统计理论
摘要
Thompson 采样是许多在线决策问题中最广泛使用的算法之一,因其在实现上的简单性以及对其他最先进方法的优越经验性能。尽管其流行和经验成功,Thompson 采样是否能匹配 臂赌博机问题的极小极大下界 (其中 为总时间范围)一直是一个未决问题。在本文中,我们通过提出一种称为 MOTS 的 Thompson 采样变体解决了这一长期开放问题,该变体在每个时间步自适应地截断所选臂的采样实例。我们证明这一简单的 Thompson 采样变体在有限时间范围 下实现了极小极大最优遗憾界 ,以及当 趋于无穷时高斯奖励的渐近最优遗憾界。据我们所知,MOTS 是首个实现多臂赌博机问题极小极大最优性的 Thompson 采样类算法。
引用
@article{arxiv.2003.01803,
title = {MOTS: Minimax Optimal Thompson Sampling},
author = {Tianyuan Jin and Pan Xu and Jieming Shi and Xiaokui Xiao and Quanquan Gu},
journal= {arXiv preprint arXiv:2003.01803},
year = {2020}
}
备注
27 pages, 1 table, 2 figures. This version improves the presentation in V2