双重先探索后提交:渐近最优性及其拓展
机器学习
2020-11-20 v2 机器学习
摘要
我们研究了具有次高斯奖励的多臂老虎机问题。先探索后提交(ETC)策略由一个探索阶段和一个利用阶段组成,是各种在线决策应用中使用最广泛的算法之一。然而,Garivier 等人(2016)已证明,随着时间范围增长,ETC 在渐近意义下是次优的,因此劣于上置信界(UCB)等全序贯策略。在本文中,我们展示了 ETC 算法的一个变体实际上可以像 UCB 类算法一样实现多臂老虎机问题的渐近最优性,并将其推广到分批老虎机设置中。具体而言,我们提出了一种双重先探索后提交(DETC)算法,该算法具有两个探索和利用阶段,并证明 DETC 达到了渐近最优的遗憾界。据我们所知,DETC 是首个实现此种渐近最优性的非全序贯算法。此外,我们将 DETC 推广到分批老虎机问题,其中(i)探索过程被划分为少量批次,且(ii)轮复杂度是核心关注点。我们证明 DETC 的分批版本仅以常数轮复杂度即可实现渐近最优性。这是首个能够同时达到最优渐近遗憾界与最优轮复杂度的分批老虎机算法。
引用
@article{arxiv.2002.09174,
title = {Double Explore-then-Commit: Asymptotic Optimality and Beyond},
author = {Tianyuan Jin and Pan Xu and Xiaokui Xiao and Quanquan Gu},
journal= {arXiv preprint arXiv:2002.09174},
year = {2020}
}
备注
46 pages. This version improves the presentation, and adds new algorithms and theoretical results: an anytime algorithm with asymptotic optimality guarantee, and an extension to K-armed bandits