中文

奖励污染下随机_bandit_中基于均值的最佳臂辨识

机器学习 2021-11-16 v1 机器学习

摘要

本文研究污染\textit{污染}随机多臂bandit中的最佳臂辨识问题。在该设定下,从任一臂获得的奖励以概率ε\varepsilon被对抗模型样本替换。考虑固定置信度(无限 horizon)设定,学习者的目标是辨识均值最大的臂。由于奖励的对抗污染,各臂均值仅可部分辨识。本文提出两种算法——一种基于间隔(gap)的算法与一种基于逐次消去的算法——用于次高斯bandit中的最佳臂辨识。这些算法涉及的均值估计在真实均值与估计值偏差上渐近达到最优误差保证。此外,这些算法渐近达到最优样本复杂度。具体地,基于间隔的算法样本复杂度渐近最优至常数因子,而基于逐次消去的算法最优至对数因子。最后给出数值实验以阐明相较现有基线的算法增益。

关键词

引用

@article{arxiv.2111.07458,
  title  = {Mean-based Best Arm Identification in Stochastic Bandits under Reward Contamination},
  author = {Arpan Mukherjee and Ali Tajer and Pin-Yu Chen and Payel Das},
  journal= {arXiv preprint arXiv:2111.07458},
  year   = {2021}
}