基于 Bandit 反馈的好臂识别
机器学习
2018-02-13 v2
摘要
我们考虑了一种新颖的随机多臂 bandit 问题,称为好臂识别(GAI),其中好臂定义为期望奖励大于或等于给定阈值的臂。GAI 是一个纯探索问题,单智能体重复一个过程:一旦某臂被识别为好臂便立即输出,而无需先确认其他臂确实不好。GAI 的目标是最小化每个过程的采样次数。我们发现 GAI 面临一种新的困境,即置信度的探索-利用困境,这与最佳臂识别的难度不同。因此,GAI 的高效算法设计与最佳臂识别截然不同。我们推导出了 GAI 采样复杂度的下界,对于接受错误率 ,该下界在相差对数因子 的意义上是紧致的。我们还开发了一种采样复杂度几乎匹配该下界的算法。我们还在基于传统 bandit 问题和类风湿性关节炎临床试验研究的合成环境中,通过实验证实了所提算法优于朴素算法。
引用
@article{arxiv.1710.06360,
title = {Good Arm Identification via Bandit Feedback},
author = {Hideaki Kano and Junya Honda and Kentaro Sakamaki and Kentaro Matsuura and Atsuyoshi Nakamura and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1710.06360},
year = {2018}
}