多阈值下优质臂识别 with bandit feedback
机器学习
2025-06-30 v3
摘要
我们考虑在具有多目标的随机 bandit 设置下进行 good arm identification问题,其中每个臂 关联一个定义在 上的分布 。对于每个轮次 ,玩家抽取一个臂 并接收根据 抽样的 维奖励向量。目标是以高概率找到一个 -good arm,其预期奖励向量大于 ,其中 为预定义阈值向量,向量比较按分量进行。我们提出了具有样本复杂度界的多阈值 UCB(MultiTUCB)算法。我们的界限在 且 的特殊情况下与现有结果相匹配。该算法在合成数据和真实数据上的表现优于基线方法。
引用
@article{arxiv.2503.10386,
title = {Multi-thresholding Good Arm Identification with Bandit Feedback},
author = {Xuanke Jiang and Sherief Hashima and Kohei Hatano and Eiji Takimoto},
journal= {arXiv preprint arXiv:2503.10386},
year = {2025}
}