中文

基于 LP 控制的收益管理之改进分析

最优化与控制 2022-03-18 v3

摘要

本文研究一类收益管理问题,其中决策者旨在有限时域内,于多类资源预算约束下最大化总收益。在每时刻,一个新订单/客户/出价被揭示,附带对某些资源的请求与一项奖励,决策者需接受或拒绝该订单。订单被接受时,必须满足资源请求并收取相关收益(奖励)。我们考虑随机设定,所有订单均为 i.i.d. 采样,即每时刻的奖励-请求对抽取自具有有限支撑的未知分布。该表述包含诸多经典应用,如基于数量的网络收益管理问题与 Adwords 问题。我们聚焦于经典基于 LP 的自适应算法,并以遗憾(regret)作为性能度量,其定义为确定等价线性规划(LP)的最优目标值与在线算法所获期望收益之间的差距。我们的贡献有二:(i)当底层 LP 非退化时,算法达到与时域/时段数 TT 无关的问题依赖型遗憾上界;(ii)当底层 LP 退化时,算法达到随 TlogT\sqrt{T}\log T 阶缩放的遗憾上界。据我们所知,两项结果均为新的,并改进了相应设定下基于 LP 自适应算法的最佳现有界。我们以数值实验作结,进一步展示我们的发现。

关键词

引用

@article{arxiv.2101.11092,
  title  = {An Improved Analysis of LP-based Control for Revenue Management},
  author = {Guanting Chen and Xiaocheng Li and Yinyu Ye},
  journal= {arXiv preprint arXiv:2101.11092},
  year   = {2022}
}

备注

50 pages