中文

具有非对称置信区间的预算多臂老虎机

机器学习 2023-08-16 v2 机器学习

摘要

我们研究随机预算多臂老虎机(MAB)问题,其中玩家从KK个具有未知期望收益与成本的臂中选择。目标是在预算约束下最大化总收益。因此,玩家力求尽可能频繁地选择收益-成本比最高的臂。该问题当前最先进的策略存在若干我们已阐明的问题。为克服这些问题,我们提出一种新的上置信界(UCB)采样策略,即ω\omega-UCB,其使用非对称置信区间。这些区间随样本均值与随机变量边界之间的距离而缩放,与现有竞争方法相比,可对收益-成本比给出更准确且紧的估计。我们证明我们的方法具有对数后悔,并在合成与真实设定中持续优于现有策略。

关键词

引用

@article{arxiv.2306.07071,
  title  = {Budgeted Multi-Armed Bandits with Asymmetric Confidence Intervals},
  author = {Marco Heyden and Vadim Arzamasov and Edouard Fouché and Klemens Böhm},
  journal= {arXiv preprint arXiv:2306.07071},
  year   = {2023}
}