有限切换下的盲网络收益管理与带背包的赌博机问题
机器学习
2025-09-18 v5 计算机科学与博弈论
最优化与控制
机器学习
摘要
本文研究有限切换对带需求学习的资源约束动态定价的影响。我们聚焦于经典的基于价格的盲网络收益管理问题,并将结果推广至带背包的赌博机(bandits with knapsacks)问题。在这两种设定下,决策者面对随机且分布未知的需求,并必须在一段时间内将有限初始库存跨多个资源进行分配。除标准资源约束外,我们施加一个切换约束,限制整个时域内动作变更的次数。我们建立了最优遗憾(regret)的匹配上下界,并开发了达到该界的计算高效的有限切换算法。我们证明最优遗憾率完全由切换预算的分段常数函数刻画,而该函数进一步依赖于资源约束的数量。我们的结果凸显了资源约束在塑造有限切换下在线学习统计复杂度中的基础作用。大量仿真表明,我们的算法在保持强劲累积奖励性能的同时,显著减少了切换次数。
引用
@article{arxiv.1911.01067,
title = {Blind Network Revenue Management and Bandits with Knapsacks under Limited Switches},
author = {David Simchi-Levi and Yunzong Xu and Jinglong Zhao},
journal= {arXiv preprint arXiv:1911.01067},
year = {2025}
}