中文

具有可补充背包的赌博机:两全其美

机器学习 2023-06-16 v1 机器学习

摘要

带背包的赌博机(BwK)框架对在线决策问题建模,其中智能体在资源消耗约束下做出一系列决策。传统模型假设每个动作消耗非负数量的资源,且当初始预算完全耗尽时过程结束。我们研究 BwK 框架的一种自然推广,其允许非单调资源利用,即资源可通过正量补充。我们提出一种最佳兼顾(best-of-both-worlds)原始对偶模板,可处理任何存在合适原始后悔最小化器的带补充在线学习问题。特别地,我们针对对抗性输入情形给出首批正向结果,表明当 B=Ω(T)B=\Omega(T) 或每轮可能补充量为正常数时,我们的框架保证常数竞争比 α\alpha。此外,在随机输入模型下,我们的算法产生与实例无关的 O~(T1/2)\tilde{O}(T^{1/2}) 后悔界,补充了该设定下已有的实例相关界。最后,我们将框架应用于若干具有实际意义的经济问题。

关键词

引用

@article{arxiv.2306.08470,
  title  = {Bandits with Replenishable Knapsacks: the Best of both Worlds},
  author = {Martino Bernasconi and Matteo Castiglioni and Andrea Celli and Federico Fusco},
  journal= {arXiv preprint arXiv:2306.08470},
  year   = {2023}
}