中文

上下文多臂老虎机中的简单后悔最小化

机器学习 2020-02-27 v2 机器学习

摘要

经典多臂老虎机(MAB)问题的两个变体近年来受到了机器学习研究者的相当关注:上下文老虎机和简单后悔最小化。上下文老虎机是MAB的一个子类,其中在每一个时间步,学习者都可以获得对最优臂具有预测作用的侧信息。简单后悔最小化假设学习者在纯探索阶段之后才产生后悔。在这项工作中,我们研究上下文老虎机的简单后悔最小化。受学习者具有分离的训练模式和自主模式的应用所驱动,我们假设学习者经历一个纯探索阶段,在该阶段每次动作后都会收到反馈但不产生后悔,随后是一个纯利用阶段,在该阶段产生后悔但没有反馈。我们提出Contextual-Gap算法,并就简单后悔(即纯利用阶段中的后悔)建立了性能保证。我们的实验考察了一种用于行星际航天器中磁场估计的自适应传感器选择的新应用,并展示出相比为最小化累积后悔而设计的算法有显著改进。

关键词

引用

@article{arxiv.1810.07371,
  title  = {Simple Regret Minimization for Contextual Bandits},
  author = {Aniket Anand Deshmukh and Srinagesh Sharma and James W. Cutler and Mark Moldwin and Clayton Scott},
  journal= {arXiv preprint arXiv:1810.07371},
  year   = {2020}
}

备注

The first two authors contributed equally