中文

AdaLinUCB:面向情境赌博机的机会式学习

机器学习 2019-05-29 v2 人工智能 机器学习

摘要

本文提出并研究机会式情境赌博机——情境赌博机的一种特殊情况,其中探索代价在不同环境条件下(如网络负载或推荐中的收益变化)而变。当探索代价较低时,拉动次优臂(例如尝试次优推荐)的实际后悔也较低。因此直观上,我们可以在探索代价相对较低时更多地探索,在探索代价相对较高时更多地利用。受此直觉启发,针对具有线性收益的机会式情境赌博机,我们提出一种自适应上置信界算法(AdaLinUCB),以自适应地平衡机会式学习的探索-利用权衡。我们证明 AdaLinUCB 达到了 O((log T)^2) 的问题相关后悔上界,其系数小于传统 LinUCB 算法。此外,基于合成和真实世界数据集,我们表明在大探索代价波动下,AdaLinUCB 显著优于其他情境赌博机算法。

关键词

引用

@article{arxiv.1902.07802,
  title  = {AdaLinUCB: Opportunistic Learning for Contextual Bandits},
  author = {Xueying Guo and Xiaoxiao Wang and Xin Liu},
  journal= {arXiv preprint arXiv:1902.07802},
  year   = {2019}
}

备注

IJCAI. 2019