中文

亚线性时间的纤维半多臂问题

机器学习 2024-05-29 v1

摘要

我们研究了纤维半多臂问题,其中在每一轮中,学习者从可行集合中 playing 一个最多为K个臂的子集,目标是最大化预期累积线性奖励。现有算法的每轮时间复杂度至少为 Ω(K)\Omega(K),当K较大时就会变得昂贵。为解决这一计算问题,我们提出了FasterCUCB,其抽样规则在K上实现亚线性时间复杂度:对于均匀纤维、分区纤维和图形纤维,时间复杂度为 O(D polylog(K) polylog(T))O(D\text{ polylog}(K)\text{ polylog}(T));对于横向纤维,时间复杂度为 O(DK polylog(T))O(D\sqrt{K}\text{ polylog}(T))。这里,D是任何可行臂子集中元素的最大数目,T是时域。我们的技术基于动态维护内积权重上的近似最大权重基的维护。虽然引入近似最大权重基在regret分析中 presents 挑战,但我们仍能保证与CUCB相同的紧致regret上界,即在asymptotically上匹配Kveton等人(2014a)提出的gap依赖下界。

关键词

引用

@article{arxiv.2405.17968,
  title  = {Matroid Semi-Bandits in Sublinear Time},
  author = {Ruo-Chun Tzeng and Naoto Ohsaka and Kaito Ariu},
  journal= {arXiv preprint arXiv:2405.17968},
  year   = {2024}
}