面向动作消失情形下的多臂老板学习
机器学习
2024-06-27 v1 机器学习
摘要
我们考虑一种新型的多臂老板 (MAB) 设置,其中学习者需要通过消失信道将动作传递给分布式代理人,而动作的奖励通过外部传感器直接获取给学习者。在我们的模型中,分布式代理人知道动作是否被消失,而中心学习者则不知道(没有反馈),因此无法确定观察到的奖励是否来自期望的动作。我们提出了一种可在任何(现有的或未来的)MAB算法之上工作并对动作消失具有鲁棒性的方案。我们的方案使得在动作消失信道下的最坏情形 regret 最多比 underlying MAB 算法在无消失情况下的最坏情形 regret 高出 的因子,其中 为消失概率。我们还提出了一种 successive arm elimination 算法的修改方案,并证明其最坏情形 regret 为 ,我们通过给出匹配的下界来证明其最优性。
引用
@article{arxiv.2406.18072,
title = {Learning for Bandits under Action Erasures},
author = {Osama Hanna and Merve Karakas and Lin F. Yang and Christina Fragouli},
journal= {arXiv preprint arXiv:2406.18072},
year = {2024}
}