基于 UCB 的多项 logistic 回归 bandit 算法
机器学习
2021-03-23 v1 机器学习
摘要
在丰富的广义线性 bandit 族中,或许研究最为深入的是用于二值奖励问题的 logistic bandit:例如,当学习器/智能体试图在具有两种可能结果(如“点击”与“未点击”)的用户上最大化收益时。尽管近期在 logistic bandit 上取得了显著进展并改进了算法,现有工作未涉及用户可选择结果数大于二的实际情形(如“点击”、“稍后展示”、“不再展示”、“未点击”)。本文研究此类扩展。我们使用多项 logit(MNL)对 种可能结果(+1 代表“未点击”结果)中每一种的概率建模:我们假设对于学习器的动作 ,用户以相应的未知参数 的多项 logit(MNL)概率模型选择 种结果之一,记为结果 。每个结果 还关联一个收益参数 ,目标是最大化期望收益。针对该问题,我们提出 MNL-UCB,一种基于上置信界(UCB)的算法,其达到遗憾 ,且对问题相关常数的依赖较小,否则这些常数可能任意大并导致宽松的遗憾界。我们给出了印证理论结果的数值模拟。
引用
@article{arxiv.2103.11489,
title = {UCB-based Algorithms for Multinomial Logistic Regression Bandits},
author = {Sanae Amani and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2103.11489},
year = {2021}
}
备注
27 pages, 5 figures