中文

多遍流带宽臂老虎机中的记忆-后悔权衡下界与锐利相变

机器学习 2022-05-03 v1 机器学习

摘要

随机 KK-臂老虎机问题因其在从在线广告到临床试验等各种领域的应用而被广泛研究。然而在实践中,臂的数量可能非常大,导致同时处理它们需要很大的内存。在本文中我们考虑一种流设置,其中臂以流的形式呈现,算法使用有限内存来处理这些臂。这里的目标不仅是最小化后悔,还要以最小内存做到这一点。该问题的先前算法在两种设置之一中运行:它们要么对流使用 Ω(loglogT)\Omega(\log \log T) 遍(Rathod, 2021; Chaudhuri and Kalyanakrishnan, 2020; Liau et al., 2018),要么仅使用单遍(Maiti et al., 2021)。在本文中,我们研究当允许对流进行 BB 遍(B1B \geq 1 任意)时内存与后悔之间的权衡,并建立了任意 BB-遍算法的紧致后悔上界与下界。我们的结果揭示了一个令人惊讶的*锐利相变现象*:在 BB 遍中 O(1)O(1) 内存足以达到 Θ~(T12+12B+22)\widetilde\Theta\Big(T^{\frac{1}{2} + \frac{1}{2^{B+2}-2}}\Big) 的后悔,而将内存增加到任何 o(K)o(K) 的量几乎对进一步降低此后悔没有影响,除非我们使用 Ω(K)\Omega(K) 内存。我们的主要技术贡献是我们的下界,它需要用到信息论技术以及轮次消除的思想来证明*残差问题*在后续遍中仍然具有挑战性。

关键词

引用

@article{arxiv.2205.00984,
  title  = {A Sharp Memory-Regret Trade-Off for Multi-Pass Streaming Bandits},
  author = {Arpit Agarwal and Sanjeev Khanna and Prathamesh Patil},
  journal= {arXiv preprint arXiv:2205.00984},
  year   = {2022}
}