亚线性时间的纤维半多臂问题
机器学习
2024-05-29 v1
摘要
我们研究了纤维半多臂问题,其中在每一轮中,学习者从可行集合中 playing 一个最多为K个臂的子集,目标是最大化预期累积线性奖励。现有算法的每轮时间复杂度至少为 ,当K较大时就会变得昂贵。为解决这一计算问题,我们提出了FasterCUCB,其抽样规则在K上实现亚线性时间复杂度:对于均匀纤维、分区纤维和图形纤维,时间复杂度为 ;对于横向纤维,时间复杂度为 。这里,D是任何可行臂子集中元素的最大数目,T是时域。我们的技术基于动态维护内积权重上的近似最大权重基的维护。虽然引入近似最大权重基在regret分析中 presents 挑战,但我们仍能保证与CUCB相同的紧致regret上界,即在asymptotically上匹配Kveton等人(2014a)提出的gap依赖下界。
引用
@article{arxiv.2405.17968,
title = {Matroid Semi-Bandits in Sublinear Time},
author = {Ruo-Chun Tzeng and Naoto Ohsaka and Kaito Ariu},
journal= {arXiv preprint arXiv:2405.17968},
year = {2024}
}