中文

具有Bandit反馈的多周期多类别打包问题的改进算法

机器学习 2023-06-02 v2 机器学习

摘要

我们考虑线性上下文多类别多周期打包问题(LMMP),其目标是打包物品,使得总消耗向量低于给定的预算向量,且总价值尽可能大。我们考虑这样一种设定:与每个动作相关的奖励和消耗向量是上下文的类别依赖线性函数,且决策者接收bandit反馈。LMMP将带背包的线性上下文bandit和在线收益管理作为特例包含在内。我们建立了一个新的估计量,保证了在此类问题中更快的收敛速度,从而更低的regret。我们提出了一种bandit策略,它是上述估计参数的闭式函数。当上下文非退化时,所提策略的regret在上下文维度、类别数以及时间范围TT上是次线性的,前提是预算至少以T\sqrt{T}的速度增长。我们还解决了Agrawal & Devanur(2016)提出的一个开放问题,并将结果推广到多类别设定。我们的数值实验清楚地表明,我们的策略性能优于文献中的其他基准。

关键词

引用

@article{arxiv.2301.13791,
  title  = {Improved Algorithms for Multi-period Multi-class Packing Problems with Bandit Feedback},
  author = {Wonyoung Kim and Garud Iyengar and Assaf Zeevi},
  journal= {arXiv preprint arXiv:2301.13791},
  year   = {2023}
}

备注

Accepted in ICML 2023, 44 pages including Appendix