中文

具有亚线性时间复杂度的线性Bandit算法

机器学习 2022-06-13 v2

摘要

我们提出了两种每步复杂度关于臂数 KK 为亚线性的线性bandit算法。这些算法专为臂集极大且缓慢变化的应用而设计。我们的核心认识是,选臂可归约为最大内积搜索(MIPS)问题,该问题可在不破坏后悔保证的前提下近似求解。现有的近似MIPS求解器以亚线性时间运行。我们扩展了这些求解器,并针对在线学习问题给出了理论保证,其中适应性(即后续步骤依赖于前序步骤的反馈)成为独特挑战。随后我们明确刻画了每步复杂度与后悔之间的权衡。当 KK 足够大时,我们的算法具有亚线性每步复杂度和 O~(T)\tilde O(\sqrt{T}) 后悔。在实验上,我们在合成环境和一个真实世界的在线电影推荐问题中评估了所提算法。相比线性时间基线,所提算法可实现超过72倍的加速,同时保持相似的后悔。

关键词

引用

@article{arxiv.2103.02729,
  title  = {Linear Bandit Algorithms with Sublinear Time Complexity},
  author = {Shuo Yang and Tongzheng Ren and Sanjay Shakkottai and Eric Price and Inderjit S. Dhillon and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2103.02729},
  year   = {2022}
}

备注

Accepted at ICML 2022