具有可补充背包的赌博机:两全其美
机器学习
2023-06-16 v1 机器学习
摘要
带背包的赌博机(BwK)框架对在线决策问题建模,其中智能体在资源消耗约束下做出一系列决策。传统模型假设每个动作消耗非负数量的资源,且当初始预算完全耗尽时过程结束。我们研究 BwK 框架的一种自然推广,其允许非单调资源利用,即资源可通过正量补充。我们提出一种最佳兼顾(best-of-both-worlds)原始对偶模板,可处理任何存在合适原始后悔最小化器的带补充在线学习问题。特别地,我们针对对抗性输入情形给出首批正向结果,表明当 或每轮可能补充量为正常数时,我们的框架保证常数竞争比 。此外,在随机输入模型下,我们的算法产生与实例无关的 后悔界,补充了该设定下已有的实例相关界。最后,我们将框架应用于若干具有实际意义的经济问题。
引用
@article{arxiv.2306.08470,
title = {Bandits with Replenishable Knapsacks: the Best of both Worlds},
author = {Martino Bernasconi and Matteo Castiglioni and Andrea Celli and Federico Fusco},
journal= {arXiv preprint arXiv:2306.08470},
year = {2023}
}