AdaLinUCB:面向情境赌博机的机会式学习
机器学习
2019-05-29 v2 人工智能
机器学习
摘要
本文提出并研究机会式情境赌博机——情境赌博机的一种特殊情况,其中探索代价在不同环境条件下(如网络负载或推荐中的收益变化)而变。当探索代价较低时,拉动次优臂(例如尝试次优推荐)的实际后悔也较低。因此直观上,我们可以在探索代价相对较低时更多地探索,在探索代价相对较高时更多地利用。受此直觉启发,针对具有线性收益的机会式情境赌博机,我们提出一种自适应上置信界算法(AdaLinUCB),以自适应地平衡机会式学习的探索-利用权衡。我们证明 AdaLinUCB 达到了 O((log T)^2) 的问题相关后悔上界,其系数小于传统 LinUCB 算法。此外,基于合成和真实世界数据集,我们表明在大探索代价波动下,AdaLinUCB 显著优于其他情境赌博机算法。
引用
@article{arxiv.1902.07802,
title = {AdaLinUCB: Opportunistic Learning for Contextual Bandits},
author = {Xueying Guo and Xiaoxiao Wang and Xin Liu},
journal= {arXiv preprint arXiv:1902.07802},
year = {2019}
}
备注
IJCAI. 2019