中文

具有向量损失的随机_bandit:最小化相对损失的 $\ell^\infty$ 范数

机器学习 2020-10-19 v1 机器学习

摘要

多臂 bandit 广泛应用于推荐系统等场景,其目标是最大化点击率。然而,还需考虑更多因素,例如用户粘性、用户增长率、用户体验评估等。本文将此情形建模为具有多重损失的 KK 臂 bandit 问题。我们定义臂的相对损失向量,其中第 ii 个分量比较该臂与最优臂在第 ii 个损失上的表现。我们研究两个目标:(a)以给定置信水平找到相对损失 \ell^\infty 范数最小的臂(即固定置信度最优臂辨识);(b)最小化累积相对损失的 \ell^\infty 范数(即遗憾最小化)。对于目标(a),我们推导了问题相关的样本复杂度下界,并讨论如何实现匹配算法。对于目标(b),我们给出了 Ω(T2/3)\Omega(T^{2/3}) 的遗憾下界并提供了匹配算法。

关键词

引用

@article{arxiv.2010.08061,
  title  = {Stochastic Bandits with Vector Losses: Minimizing $\ell^\infty$-Norm of Relative Losses},
  author = {Xuedong Shang and Han Shao and Jian Qian},
  journal= {arXiv preprint arXiv:2010.08061},
  year   = {2020}
}

备注

14 pages