非平稳环境下的带背包多臂赌博机问题
机器学习
2022-10-13 v2 机器学习
摘要
本文研究非平稳环境下的带背包多臂赌博机(BwK)问题。BwK 问题将多臂赌博机(MAB)问题推广以建模拉动每个臂所带来的资源消耗。在每一时刻,决策者/玩家选择拉动一个臂,并将获得奖励并从多种资源类型中的每一种消耗一定数量的资源。目标是在有限时域内最大化累积奖励,同时满足关于资源的若干背包约束。现有工作研究随机或对抗环境下的 BwK 问题。本文考虑在这两种极端之间连续过渡的非平稳环境。我们首先表明,由于约束的存在,传统的变异预算概念不足以刻画 BwK 问题的非平稳性以达成次线性后悔,随后我们提出全局非平稳性度量这一新概念。我们运用这两种非平稳性度量推导该问题的上界与下界。我们的结果基于底层线性规划的原始对偶分析,并凸显了约束与非平稳性之间的相互作用。最后,我们还将该非平稳性度量推广至带约束的在线凸优化问题,并相应得到新的后悔界。
引用
@article{arxiv.2205.12427,
title = {Non-stationary Bandits with Knapsacks},
author = {Shang Liu and Jiashuo Jiang and Xiaocheng Li},
journal= {arXiv preprint arXiv:2205.12427},
year = {2022}
}