中文

面向多预测器 bandit 访问的 MTS 学习增强算法

机器学习 2025-06-09 v1 数据结构与算法

摘要

我们考虑以下问题:我们给定 \ell 个针对度量任务系统 (MTS) 的启发式方法,其中每个方法可能针对不同类型的输入实例而设计。虽然处理收到的输入实例时,我们只能在每个时间步骤查询其中一个启发式方法的动作。我们的目标是实现与给定启发式方法中最佳者相当的性能。我们设置的主要难点在于,除非同一启发式方法在时间 t1t-1 也被查询,否则无法估计该方法在时间 tt 的代价。这与在记忆受限对手环境下的 bandit 学习相关 (Arora 等,2012)。我们展示了如何实现 O(OPT2/3)O(\text{OPT}^{2/3}) 的 regret,并证明了基于 Dekel 等 (2013) 构造的紧下界。

引用

@article{arxiv.2506.05479,
  title  = {Learning-Augmented Algorithms for MTS with Bandit Access to Multiple Predictors},
  author = {Matei Gabriel Coşa and Marek Eliáš},
  journal= {arXiv preprint arXiv:2506.05479},
  year   = {2025}
}

备注

Accepted to ICML 2025