中文

线性_bandit中的鲁棒最优臂辨识

机器学习 2023-11-09 v1 机器学习

摘要

我们研究线性奖励情形下的鲁棒最优臂辨识问题(RBAI)。主要目标是辨识一个近最优的鲁棒臂,这涉及在每一轮选择臂并通过探索潜在的对抗动作来评估其鲁棒性。当使用模拟器并希望为真实世界迁移辨识鲁棒解时,该方法尤为相关。为此,我们给出了线性奖励鲁棒最优臂辨识问题的实例依赖下界。此外,我们提出了静态与自适应bandit算法,其样本复杂度与该下界匹配。在合成实验中,我们的算法有效辨识出最佳鲁棒臂,并与预言机策略表现相似。作为一个应用,我们考察了糖尿病护理以及学习对标准计算器误差具有鲁棒性的胰岛素剂量推荐。我们的算法证明能在不同年龄段患者中有效辨识鲁棒剂量值。

关键词

引用

@article{arxiv.2311.04731,
  title  = {Robust Best-arm Identification in Linear Bandits},
  author = {Wei Wang and Sattar Vakili and Ilija Bogunovic},
  journal= {arXiv preprint arXiv:2311.04731},
  year   = {2023}
}