具有向量损失的随机_bandit:最小化相对损失的 $\ell^\infty$ 范数
机器学习
2020-10-19 v1 机器学习
摘要
多臂 bandit 广泛应用于推荐系统等场景,其目标是最大化点击率。然而,还需考虑更多因素,例如用户粘性、用户增长率、用户体验评估等。本文将此情形建模为具有多重损失的 臂 bandit 问题。我们定义臂的相对损失向量,其中第 个分量比较该臂与最优臂在第 个损失上的表现。我们研究两个目标:(a)以给定置信水平找到相对损失 范数最小的臂(即固定置信度最优臂辨识);(b)最小化累积相对损失的 范数(即遗憾最小化)。对于目标(a),我们推导了问题相关的样本复杂度下界,并讨论如何实现匹配算法。对于目标(b),我们给出了 的遗憾下界并提供了匹配算法。
引用
@article{arxiv.2010.08061,
title = {Stochastic Bandits with Vector Losses: Minimizing $\ell^\infty$-Norm of Relative Losses},
author = {Xuedong Shang and Han Shao and Jian Qian},
journal= {arXiv preprint arXiv:2010.08061},
year = {2020}
}
备注
14 pages