带背包在线学习的最佳多世界保证
机器学习
2023-03-13 v2
摘要
我们研究在线学习问题,其中决策者希望最大化其期望收益而不违反一组有限的 个资源约束。通过在适当定义的策略混合空间上刻画学习过程,我们恢复了底层优化问题拉格朗日松弛上的强对偶性,即便在具有非凸收益与资源消耗函数的一般设定下亦如此。随后,我们为该设定提供首个最佳多世界(best-of-many-worlds)类型框架,在随机、对抗和非平稳输入下均具有无遗憾保证。我们的框架在随机情形下给出了与先前工作相同的遗憾保证。另一方面,当预算至少随时间范围线性增长时,它使我们在对抗情形下能提供常数竞争比,这改进了已知最优上界 。此外,我们的框架允许决策者处理非凸收益与成本函数。我们给出该框架的两个博弈论应用以进一步证明其灵活性。在此过程中,我们展示其可用于在重复首次价格拍卖中实现预算 pacing 机制。
引用
@article{arxiv.2202.13710,
title = {Best of Many Worlds Guarantees for Online Learning with Knapsacks},
author = {Andrea Celli and Matteo Castiglioni and Christian Kroer},
journal= {arXiv preprint arXiv:2202.13710},
year = {2023}
}