一种用于组合探索的固定预算最佳臂识别算法
机器学习
2026-01-30 v2
摘要
我们考虑的最佳臂识别 (BAI) 问题在 臂 bandit 框架中进行修改——在每个时间槽中,智能体允许播放一组臂的子集而非单个臂。因此,智能体仅观察到构成所探测子集的臂奖励样本平均值。在此情境下,存在若干权衡——例如,同时采样更多臂会提供更广阔的环境视图,而采样较少的臂则增强对单个奖励分布的了解。此外,对大量次优臂进行分组虽会降低该组合奖励的方差,但可能将组合均值拉近到包含最优臂的组合。为解决此问题,我们提出一种算法,该算法构造 个组,并对每个组执行似然比检验以检测是否存在最佳臂。随后采用 Hamming 解码程序确定唯一的最佳臂。我们基于新的困难参数 推导了所提出算法错误概率的上界。最后,我们展示了在某些情况下,该算法优于针对单次播放情况的最新算法。
引用
@article{arxiv.2502.01429,
title = {An Algorithm for Fixed Budget Best Arm Identification with Combinatorial Exploration},
author = {Siddhartha Parupudi and Gourab Ghatak},
journal= {arXiv preprint arXiv:2502.01429},
year = {2026}
}