中文

基于Contextual Bandit的流式主动学习方法

机器学习 2017-01-25 v1

摘要

Contextual bandit算法——一类利用上下文信息的多臂老虎机算法——已被证明能有效解决不确定性下的序贯决策问题。文献中采用的一个常见假设是,学习者无需代价即可观察到采取所选动作后实现(真实值)的奖励,然而这在许多实际场景中并不现实。当观察真实奖励代价高昂时,学习者的一个关键挑战是如何通过评估收益与成本来明智地获取真实值,以平衡学习效率和学习成本。从信息论视角看,或许更有趣的问题是,由于该成本可能损失多少效率。在本文中,我们设计了一种新颖的基于contextual bandit的学习算法,并赋予其主动学习能力。我们算法的关键特征是,除了向标注者发送查询以获取真实值外,还一并发送学习者已学到的关于真实值的先验信息,从而降低查询成本。我们证明,通过仔细选择算法参数,所提算法的学习后悔达到与无成本场景下传统contextual bandit算法同阶的水平,这意味着令人惊讶地,获取真实值的成本在长期内并未增加学习后悔。我们的分析表明,在需要主动学习的场景中,关于真实值的先验信息对提升系统性能起着关键作用。

关键词

引用

@article{arxiv.1701.06725,
  title  = {A Contextual Bandit Approach for Stream-Based Active Learning},
  author = {Linqi Song and Jie Xu},
  journal= {arXiv preprint arXiv:1701.06725},
  year   = {2017}
}

备注

arXiv admin note: text overlap with arXiv:1607.03182