具有Bandit反馈的多周期多类别打包问题的改进算法
机器学习
2023-06-02 v2 机器学习
摘要
我们考虑线性上下文多类别多周期打包问题(LMMP),其目标是打包物品,使得总消耗向量低于给定的预算向量,且总价值尽可能大。我们考虑这样一种设定:与每个动作相关的奖励和消耗向量是上下文的类别依赖线性函数,且决策者接收bandit反馈。LMMP将带背包的线性上下文bandit和在线收益管理作为特例包含在内。我们建立了一个新的估计量,保证了在此类问题中更快的收敛速度,从而更低的regret。我们提出了一种bandit策略,它是上述估计参数的闭式函数。当上下文非退化时,所提策略的regret在上下文维度、类别数以及时间范围上是次线性的,前提是预算至少以的速度增长。我们还解决了Agrawal & Devanur(2016)提出的一个开放问题,并将结果推广到多类别设定。我们的数值实验清楚地表明,我们的策略性能优于文献中的其他基准。
引用
@article{arxiv.2301.13791,
title = {Improved Algorithms for Multi-period Multi-class Packing Problems with Bandit Feedback},
author = {Wonyoung Kim and Garud Iyengar and Assaf Zeevi},
journal= {arXiv preprint arXiv:2301.13791},
year = {2023}
}
备注
Accepted in ICML 2023, 44 pages including Appendix