具有臂层级结构的 Top-$k$ 极端上下文_bandit 问题
机器学习
2021-02-17 v1 人工智能
机器学习
摘要
受在线广告与推荐系统等现代应用驱动,我们研究 top- 极端上下文_bandit 问题,其中臂的总数可能极其庞大,且允许学习器选择 个臂并观测所选臂的全部或部分奖励。我们首先针对非极端可实现设定提出一种算法,利用逆间隙加权策略选择多个臂。我们证明该算法的后悔界为 ,其中 为臂的总数, 为包含回归函数的函数类,且每时间步仅需 的计算量。在臂总数可达数百万的极端设定中,我们提出一种受实际驱动的臂层级模型,该模型在均值奖励中诱导出特定结构以保证统计与计算效率。层级结构使每个上下文的相关臂数量呈指数级减少,从而得到 的后悔界。最后,我们使用层级线性函数类实现算法,并在基于极端多标签分类数据集的模拟_bandit 反馈实验中,相对于知名基准展现出优越性能。在一个含三百万臂的数据集上,我们的约简方案平均推理时间仅 7.9 毫秒,实现了 100 倍提升。
引用
@article{arxiv.2102.07800,
title = {Top-$k$ eXtreme Contextual Bandits with Arm Hierarchy},
author = {Rajat Sen and Alexander Rakhlin and Lexing Ying and Rahul Kidambi and Dean Foster and Daniel Hill and Inderjit Dhillon},
journal= {arXiv preprint arXiv:2102.07800},
year = {2021}
}