中文

纯粹探索下的奖励最大化:非参数多臂老虎机的下矢盫最优好臂识别

机器学习 2024-10-22 v1 统计方法学 机器学习

摘要

在多臂老虎机中,奖励最大化和纯粹探索的任务往往相互矛盾。前者侧重于利用均值最高的臂,而后者可能需要在所有臂上保持持续的探索。在本工作中,我们关注好臂识别(Good Arm Identification, GAI),这是一种实际的 bandit 推断目标,旨在尽快标记均值高于阈值的臂。我们展示了GAI可以通过结合奖励最大化采样算法与一种新型的非参数即时有效顺序测试来高效地解决。首先,我们确立了该顺序测试在高度非参数假设下维持错误控制,并在渐进上实现下矢盫最优的e-power,这是一种用于即时有效测试的功效概念。接下来,通过将 regret最小化采样方案与我们的顺序测试结合,我们提供了一种在错误概率约束下实现标记均值高于阈值臂的下矢盫最优停止时间的方法。我们的实证结果表明,我们的方法在超出下矢盫情境的情况下也有效,通过两套合成和真实世界设置中,所有停止时间的预期样本数至少减少50%。

关键词

引用

@article{arxiv.2410.15564,
  title  = {Reward Maximization for Pure Exploration: Minimax Optimal Good Arm Identification for Nonparametric Multi-Armed Bandits},
  author = {Brian Cho and Dominik Meier and Kyra Gan and Nathan Kallus},
  journal= {arXiv preprint arXiv:2410.15564},
  year   = {2024}
}