中文

生存赌博机问题

机器学习 2024-01-09 v4 机器学习

摘要

我们引入并研究了一种多臂赌博机问题(MAB)的新变体,称为生存赌博机问题(S-MAB)。尽管两问题的目标均为最大化所谓的累积奖励,但在该新变体中,若累积奖励低于预设阈值则过程中断。这一简单却未被探索的 MAB 扩展源于诸多实际应用。例如,在志愿患者上相互测试两种药物时,人们的健康面临风险,若发生严重副作用或治疗未缓解疾病症状,有必要中断实验。从理论角度看,S-MAB 是首个过程可能中断也可能不中断的 MAB 变体。我们首先形式化 S-MAB,并将其目标定义为最小化所谓的生存后悔,它自然推广了 MAB 的后悔。接着我们表明,S-MAB 的目标比 MAB 困难得多:与 MAB 相反,任何策略都无法实现合理小(即次线性)的生存后悔。作为替代,我们在帕累托意义下最小化生存后悔,即寻求这样一种策略——对某些问题实例其累积奖励无法在不牺牲另一实例的情况下被改进。为此,我们辨识出生存后悔中的两个关键部分:未破产时的后悔(对应 MAB 中的后悔),以及过程被中断的概率,称为破产概率。我们推导了破产概率的下界,以及破产概率达到该下界的策略。最后,基于这些策略的加倍技巧,我们导出在帕累托意义下最小化生存后悔的策略,回答了 Perotto 等人(COLT 2019)的一个开放问题。

关键词

引用

@article{arxiv.2206.03019,
  title  = {The Survival Bandit Problem},
  author = {Charles Riou and Junya Honda and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2206.03019},
  year   = {2024}
}