中文

多阈值下优质臂识别 with bandit feedback

机器学习 2025-06-30 v3

摘要

我们考虑在具有多目标的随机 bandit 设置下进行 good arm identification问题,其中每个臂 i[K]i \in [K] 关联一个定义在 RMR^M 上的分布 DiD_i。对于每个轮次 tt,玩家抽取一个臂 iti_t 并接收根据 DitD_{i_t} 抽样的 MM 维奖励向量。目标是以高概率找到一个 ϵ\epsilon-good arm,其预期奖励向量大于 ξϵ1\bm{\xi} - \epsilon \mathbf{1},其中 ξ\bm{\xi} 为预定义阈值向量,向量比较按分量进行。我们提出了具有样本复杂度界的多阈值 UCB(MultiTUCB)算法。我们的界限在 M=1M=1ϵ=0\epsilon=0 的特殊情况下与现有结果相匹配。该算法在合成数据和真实数据上的表现优于基线方法。

关键词

引用

@article{arxiv.2503.10386,
  title  = {Multi-thresholding Good Arm Identification with Bandit Feedback},
  author = {Xuanke Jiang and Sherief Hashima and Kohei Hatano and Eiji Takimoto},
  journal= {arXiv preprint arXiv:2503.10386},
  year   = {2025}
}