中文

抗损坏线性多臂 bandit: 次下界最优性与间隔相关误模型

机器学习 2024-10-21 v3 机器学习

摘要

在线性多臂 bandit 中,学习者如何在遭遇被损坏奖励时有效学习?尽管已有大量工作探索了这一问题,但缺乏对不同对抗模型和损坏度量进行全面理解,亦缺乏对次下界 regret 界限的完整刻画。在本工作中,我们比较了两种常见的损坏类型:强损坏(其中损坏程度取决于学习者所选择的动作)和弱损坏(其中损坏程度不取决于所选择的动作)。我们提供了一个统一的框架来分析这些损坏。对于随机线性 bandit,我们完全刻画了在强损坏与弱损坏之间的次下界 regret 之间的差距。我们还着手研究被损坏的对抗性线性 bandit,获取上界和下界并吻合对损坏程度的依赖。随后,我们揭示了抗损坏学习与学习 with gap-dependent mis-specification 之间的联系,后者由 Liu 等人(2023a)首次研究,其中某一动作或策略的误模型程度与其次优性成正比。我们提出一种通用化约简,使任何抗损坏算法都能处理 gap-dependent mis-specification。这使我们能够以黑盒方式恢复 Liu 等人(2023a)的结果,并显著推广到诸如线性 MDP 等设置,推出了关于 gap-dependent mis-specification 在强化学习中首次的结果。然而,该通用化约简无法达到 gap-dependent mis-specification 的最优率。为此,我们发展出一种专用算法,实现线性 bandit 中 gap-dependent mis-specification 的最优界限,从而回答了 Liu 等人(2023a)提出的开放问题。

关键词

引用

@article{arxiv.2410.07533,
  title  = {Corruption-Robust Linear Bandits: Minimax Optimality and Gap-Dependent Misspecification},
  author = {Haolin Liu and Artin Tajdini and Andrew Wagenmaker and Chen-Yu Wei},
  journal= {arXiv preprint arXiv:2410.07533},
  year   = {2024}
}

备注

NeurIPS 2024