中文

用于优化上下文老虎机的安全探索

信息检索 2020-02-06 v1 机器学习

摘要

上下文老虎机问题天然适用于许多信息检索任务,例如学习排序、文本分类、推荐等。然而,现有的上下文老虎机问题学习方法存在以下两种缺陷之一:它们要么不探索所有可能文档排序(即动作)的空间,从而可能错过最优排序;要么向用户呈现次优排序,从而可能损害用户体验。我们引入了一种用于上下文老虎机问题的新学习方法——安全探索算法(SEA),它克服了上述缺陷。SEA 首先使用一个基线(或生产)排序系统(即策略),该系统不会损害用户体验,因此执行是安全的,但性能次优,因此需要改进。随后 SEA 利用反事实学习基于基线策略的行为学习新策略。SEA 还使用高置信度离策略评估来估计新学习策略的性能。一旦新学习策略的性能至少与基线策略相当,SEA 就开始使用新策略执行新动作,使其能够主动探索动作空间中的有利区域。这样,SEA 永远不会比基线策略表现更差,因此不会损害用户体验,同时仍探索动作空间,从而能够找到最优策略。我们使用文本分类和文档检索的实验,通过将 SEA(以及称为 BSEA 的无界变体)与上下文老虎机问题的在线和离线学习方法进行比较,证实了上述结论。

关键词

引用

@article{arxiv.2002.00467,
  title  = {Safe Exploration for Optimizing Contextual Bandits},
  author = {Rolf Jagerman and Ilya Markov and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2002.00467},
  year   = {2020}
}

备注

23 pages, 3 figures