中文

在线资源分配:Bandit反馈与时变需求下的建议

机器学习 2023-06-13 v2 最优化与控制

摘要

我们考虑一种具有bandit反馈和时变需求的通用在线资源分配模型。尽管在线资源分配已在文献中被充分研究,大多数现有工作做出需求到达过程平稳的强假设。然而,在实际应用中,如在线广告与收益管理,该过程可能是外生且非平稳的,如同不断变化的互联网流量。受近期带建议的在线算法框架[Mitazenmacher and Vassilvitskii, Commun. ACM 2022]启发,我们探索在线建议如何指导策略设计。我们建立了一个不可能性结果:在我们的设定中,任何算法若无任何建议将在后悔值方面表现糟糕。相反,我们设计了一种利用对总需求量的在线预测的鲁棒在线算法。借助在线建议,我们提出的算法相较于文献中其他算法被证明具有理论性能与有前景的数值结果。我们还提供了时变需求场景的两个显式示例并推导相应的理论性能保证。最后,我们将模型适配于网络收益管理问题,并通过数值证明我们的算法相较于现有基线仍具竞争力。

关键词

引用

@article{arxiv.2302.04182,
  title  = {Online Resource Allocation: Bandits feedback and Advice on Time-varying Demands},
  author = {Lixing Lyu and Wang Chi Cheung},
  journal= {arXiv preprint arXiv:2302.04182},
  year   = {2023}
}

备注

74 pages. A preliminary short version entitled "Non-Stationary Bandits with Knapsack Problems with Advice" is accepted to ICML 2023