中文

面向动作消失情形下的多臂老板学习

机器学习 2024-06-27 v1 机器学习

摘要

我们考虑一种新型的多臂老板 (MAB) 设置,其中学习者需要通过消失信道将动作传递给分布式代理人,而动作的奖励通过外部传感器直接获取给学习者。在我们的模型中,分布式代理人知道动作是否被消失,而中心学习者则不知道(没有反馈),因此无法确定观察到的奖励是否来自期望的动作。我们提出了一种可在任何(现有的或未来的)MAB算法之上工作并对动作消失具有鲁棒性的方案。我们的方案使得在动作消失信道下的最坏情形 regret 最多比 underlying MAB 算法在无消失情况下的最坏情形 regret 高出 O(1/1ϵ)O(1/\sqrt{1-\epsilon}) 的因子,其中 ϵ\epsilon 为消失概率。我们还提出了一种 successive arm elimination 算法的修改方案,并证明其最坏情形 regret 为 O~(KT+K/(1ϵ))\tilde{O}(\sqrt{KT}+K/(1-\epsilon)),我们通过给出匹配的下界来证明其最优性。

关键词

引用

@article{arxiv.2406.18072,
  title  = {Learning for Bandits under Action Erasures},
  author = {Osama Hanna and Merve Karakas and Lin F. Yang and Christina Fragouli},
  journal= {arXiv preprint arXiv:2406.18072},
  year   = {2024}
}