中文

带延迟的容量受限在线学习:调度框架与 regret 折中

机器学习 2025-06-27 v2 机器学习

摘要

我们研究了在新颖的“容量约束”下进行的含延迟在线学习,该约束限制了同时可跟踪的过去轮次数量。对于“先知式”(即每轮提前揭示延迟时长)和/或“可抢占式”(即可停止跟踪先前选定轮次的反馈),我们建立了在容量水平上实现 minimax 率的匹配上界和下界(高达对数因子),刻画了实现经典延迟在线学习(即隐含无限容量)minimax 率所需的“最优容量”。我们的算法在所有容量水平上均实现 minimax 最优 regret,性能在次优容量下优雅地退化。对于 K 个动作和总延迟为 D 的 T 轮,在先知式假设下若容量为 C=Ω(log(T))C = \Omega(\log(T)),则对 bandits 实现 regret Θ~(TK+DK/C+Dlog(K))\widetilde{\Theta}(\sqrt{TK + DK/C + D\log(K)}),对 full-information feedback 实现 regret Θ~((D+T)log(K))\widetilde{\Theta}(\sqrt{(D+T)\log(K)})。当用可抢占式取代先知式时,需要已知的最大延迟上界 dmaxd_{\max},额外增加 O~(dmax){\widetilde{O}(d_{\max})} 到 regret。对于固定延迟 dd(即 D=TdD=Td),在 bandit 设置下,minimax regret 为 Θ(TK(1+d/C)+Tdlog(K))\Theta(\sqrt{TK(1+d/C)+Td\log(K)}),最优容量为 Θ(min{K/log(K),d})\Theta(\min\{K/\log(K),d\});在 full-information feedback 设置下,minimax regret 为 Θ(T(d+1)log(K))\Theta(\sqrt{T(d+1)\log(K)}),最优容量为 Θ(1)\Theta(1)。对于轮次相关和固定延迟,我们的上界通过基于 Pareto 分布代理延迟的抢占式和非抢占式调度策略以及分批技术实现。关键在于,我们的工作统一了延迟 bandits、标签高效学习和在线调度框架,表明即使在延迟反馈下,仅凭惊人有限的跟踪容量即可实现稳健的在线学习。

关键词

引用

@article{arxiv.2503.19856,
  title  = {Capacity-Constrained Online Learning with Delays: Scheduling Frameworks and Regret Trade-offs},
  author = {Alexander Ryabchenko and Idan Attias and Daniel M. Roy},
  journal= {arXiv preprint arXiv:2503.19856},
  year   = {2025}
}