带延迟的容量受限在线学习:调度框架与 regret 折中
机器学习
2025-06-27 v2 机器学习
摘要
我们研究了在新颖的“容量约束”下进行的含延迟在线学习,该约束限制了同时可跟踪的过去轮次数量。对于“先知式”(即每轮提前揭示延迟时长)和/或“可抢占式”(即可停止跟踪先前选定轮次的反馈),我们建立了在容量水平上实现 minimax 率的匹配上界和下界(高达对数因子),刻画了实现经典延迟在线学习(即隐含无限容量)minimax 率所需的“最优容量”。我们的算法在所有容量水平上均实现 minimax 最优 regret,性能在次优容量下优雅地退化。对于 K 个动作和总延迟为 D 的 T 轮,在先知式假设下若容量为 ,则对 bandits 实现 regret ,对 full-information feedback 实现 regret 。当用可抢占式取代先知式时,需要已知的最大延迟上界 ,额外增加 到 regret。对于固定延迟 (即 ),在 bandit 设置下,minimax regret 为 ,最优容量为 ;在 full-information feedback 设置下,minimax regret 为 ,最优容量为 。对于轮次相关和固定延迟,我们的上界通过基于 Pareto 分布代理延迟的抢占式和非抢占式调度策略以及分批技术实现。关键在于,我们的工作统一了延迟 bandits、标签高效学习和在线调度框架,表明即使在延迟反馈下,仅凭惊人有限的跟踪容量即可实现稳健的在线学习。
引用
@article{arxiv.2503.19856,
title = {Capacity-Constrained Online Learning with Delays: Scheduling Frameworks and Regret Trade-offs},
author = {Alexander Ryabchenko and Idan Attias and Daniel M. Roy},
journal= {arXiv preprint arXiv:2503.19856},
year = {2025}
}