中文

带背包在线学习的最佳多世界保证

机器学习 2023-03-13 v2

摘要

我们研究在线学习问题,其中决策者希望最大化其期望收益而不违反一组有限的 mm 个资源约束。通过在适当定义的策略混合空间上刻画学习过程,我们恢复了底层优化问题拉格朗日松弛上的强对偶性,即便在具有非凸收益与资源消耗函数的一般设定下亦如此。随后,我们为该设定提供首个最佳多世界(best-of-many-worlds)类型框架,在随机、对抗和非平稳输入下均具有无遗憾保证。我们的框架在随机情形下给出了与先前工作相同的遗憾保证。另一方面,当预算至少随时间范围线性增长时,它使我们在对抗情形下能提供常数竞争比,这改进了已知最优上界 O(logmlogT)O(\log m \log T)。此外,我们的框架允许决策者处理非凸收益与成本函数。我们给出该框架的两个博弈论应用以进一步证明其灵活性。在此过程中,我们展示其可用于在重复首次价格拍卖中实现预算 pacing 机制。

关键词

引用

@article{arxiv.2202.13710,
  title  = {Best of Many Worlds Guarantees for Online Learning with Knapsacks},
  author = {Andrea Celli and Matteo Castiglioni and Christian Kroer},
  journal= {arXiv preprint arXiv:2202.13710},
  year   = {2023}
}