多全其美:用于在线分配问题的对偶镜像下降
数据结构与算法
2021-11-08 v3 机器学习
最优化与控制
摘要
带资源约束的在线分配问题是收益管理与在线广告中的核心问题。在这些问题中,请求在有限时域内顺序到达,且对于每个请求,决策者需要选择消耗一定量资源并产生奖励的动作。目标是在资源总消耗约束下最大化累积奖励。在本文中,我们考虑一种数据驱动设定,其中每个请求的奖励与资源消耗由决策者未知的输⼊模型生成。我们设计了一类通用算法,可在各类输⼊模型下取得良好性能而无需知晓所面对的输⼊类型。具体而言,我们的算法在独立同分布输⼊以及各种非平稳随机输⼊模型下渐近最优,且在输⼊为对抗性时获得渐近最优的固定竞争比。我们的算法在拉格朗日对偶空间中运行:它们为每个资源维护一个对偶乘子,并使用在线镜像下降更新。通过相应选择参考函数,我们恢复了对偶次梯度下降与对偶乘性权重更新算法。所得算法简单、快速,且不需要收益函数、消耗函数与动作空间的凸性,这与现有的在线分配问题方法形成对比。我们讨论了在网络收益管理、带预算约束的重复拍卖在线出价、高熵在线比例匹配以及有限库存的个性化 assortment 优化中的应用。
引用
@article{arxiv.2011.10124,
title = {The Best of Many Worlds: Dual Mirror Descent for Online Allocation Problems},
author = {Santiago Balseiro and Haihao Lu and Vahab Mirrokni},
journal= {arXiv preprint arXiv:2011.10124},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2002.10421