中文

具有臂层级结构的 Top-$k$ 极端上下文_bandit 问题

机器学习 2021-02-17 v1 人工智能 机器学习

摘要

受在线广告与推荐系统等现代应用驱动,我们研究 top-kk 极端上下文_bandit 问题,其中臂的总数可能极其庞大,且允许学习器选择 kk 个臂并观测所选臂的全部或部分奖励。我们首先针对非极端可实现设定提出一种算法,利用逆间隙加权策略选择多个臂。我们证明该算法的后悔界为 O(k(Ak+1)Tlog(FT))O(k\sqrt{(A-k+1)T \log (|\mathcal{F}|T)}),其中 AA 为臂的总数,F\mathcal{F} 为包含回归函数的函数类,且每时间步仅需 O~(A)\tilde{O}(A) 的计算量。在臂总数可达数百万的极端设定中,我们提出一种受实际驱动的臂层级模型,该模型在均值奖励中诱导出特定结构以保证统计与计算效率。层级结构使每个上下文的相关臂数量呈指数级减少,从而得到 O(k(logAk+1)Tlog(FT))O(k\sqrt{(\log A-k+1)T \log (|\mathcal{F}|T)}) 的后悔界。最后,我们使用层级线性函数类实现算法,并在基于极端多标签分类数据集的模拟_bandit 反馈实验中,相对于知名基准展现出优越性能。在一个含三百万臂的数据集上,我们的约简方案平均推理时间仅 7.9 毫秒,实现了 100 倍提升。

关键词

引用

@article{arxiv.2102.07800,
  title  = {Top-$k$ eXtreme Contextual Bandits with Arm Hierarchy},
  author = {Rajat Sen and Alexander Rakhlin and Lexing Ying and Rahul Kidambi and Dean Foster and Daniel Hill and Inderjit Dhillon},
  journal= {arXiv preprint arXiv:2102.07800},
  year   = {2021}
}