中文

基于 Bandit 反馈的好臂识别

机器学习 2018-02-13 v2

摘要

我们考虑了一种新颖的随机多臂 bandit 问题,称为好臂识别(GAI),其中好臂定义为期望奖励大于或等于给定阈值的臂。GAI 是一个纯探索问题,单智能体重复一个过程:一旦某臂被识别为好臂便立即输出,而无需先确认其他臂确实不好。GAI 的目标是最小化每个过程的采样次数。我们发现 GAI 面临一种新的困境,即置信度的探索-利用困境,这与最佳臂识别的难度不同。因此,GAI 的高效算法设计与最佳臂识别截然不同。我们推导出了 GAI 采样复杂度的下界,对于接受错误率 δ\delta,该下界在相差对数因子 O(log1δ)\mathrm{O}(\log \frac{1}{\delta}) 的意义上是紧致的。我们还开发了一种采样复杂度几乎匹配该下界的算法。我们还在基于传统 bandit 问题和类风湿性关节炎临床试验研究的合成环境中,通过实验证实了所提算法优于朴素算法。

关键词

引用

@article{arxiv.1710.06360,
  title  = {Good Arm Identification via Bandit Feedback},
  author = {Hideaki Kano and Junya Honda and Kentaro Sakamaki and Kentaro Matsuura and Atsuyoshi Nakamura and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:1710.06360},
  year   = {2018}
}