上下文多臂老虎机框架中的基于流的在线主动学习
机器学习
2016-07-13 v1
摘要
我们研究了上下文多臂老虎机框架中的基于流的在线主动学习。在该框架中,奖励同时取决于臂和上下文。在基于流的主动学习设定中,获取奖励的真值代价高昂,传统的上下文多臂老虎机算法由于该代价而无法实现次线性遗憾。因此,算法需要决定是否在当前时隙请求奖励的真值。在我们的框架中,我们考虑了一种基于流的主动学习设定,其中向标注者发送对真值的查询请求,同时附带一些关于真值的先验信息。根据先验信息的准确程度,查询代价有所不同。我们的算法主要执行两种操作:上下文和臂空间的细化以及动作的选择。在我们的算法中,上下文空间和臂空间的划分被维持一定数量的时隙,然后随着关于奖励的信息积累而变得更精细。我们采用一种策略性方式来选择臂并请求奖励的真值,旨在最大化总奖励。我们分析地表明,遗憾是次线性的,且与传统的上下文多臂老虎机算法(无查询代价)处于同一量级。
引用
@article{arxiv.1607.03182,
title = {Stream-based Online Active Learning in a Contextual Multi-Armed Bandit Framework},
author = {Linqi Song},
journal= {arXiv preprint arXiv:1607.03182},
year = {2016}
}