中文

基于 UCB 的多项 logistic 回归 bandit 算法

机器学习 2021-03-23 v1 机器学习

摘要

在丰富的广义线性 bandit 族中,或许研究最为深入的是用于二值奖励问题的 logistic bandit:例如,当学习器/智能体试图在具有两种可能结果(如“点击”与“未点击”)的用户上最大化收益时。尽管近期在 logistic bandit 上取得了显著进展并改进了算法,现有工作未涉及用户可选择结果数大于二的实际情形(如“点击”、“稍后展示”、“不再展示”、“未点击”)。本文研究此类扩展。我们使用多项 logit(MNL)对 K+12K+1\geq 2 种可能结果(+1 代表“未点击”结果)中每一种的概率建模:我们假设对于学习器的动作 xt\mathbf{x}_t,用户以相应的未知参数 θˉi\bar{\boldsymbol\theta}_{\ast i} 的多项 logit(MNL)概率模型选择 K+12K+1\geq 2 种结果之一,记为结果 ii。每个结果 ii 还关联一个收益参数 ρi\rho_i,目标是最大化期望收益。针对该问题,我们提出 MNL-UCB,一种基于上置信界(UCB)的算法,其达到遗憾 O~(dKT)\tilde{\mathcal{O}}(dK\sqrt{T}),且对问题相关常数的依赖较小,否则这些常数可能任意大并导致宽松的遗憾界。我们给出了印证理论结果的数值模拟。

关键词

引用

@article{arxiv.2103.11489,
  title  = {UCB-based Algorithms for Multinomial Logistic Regression Bandits},
  author = {Sanae Amani and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2103.11489},
  year   = {2021}
}

备注

27 pages, 5 figures