中文

具有线性效用函数的多项 Logit 赌博机

机器学习 2019-03-05 v2 人工智能 机器学习

摘要

多项 logit 赌博机是一类出现在诸多应用中的序贯子集选择问题。每轮中,玩家从 NN 个候选物品中选择一个 KK 基数的子集,并获得由{\it 多项 logit}(MNL)选择模型决定的奖励,该模型同时考虑物品效用及物品间替代性质。玩家的目标是在有限时域 TT 内动态学习 MNL 模型参数并最大化累积奖励。该问题面临探索-利用困境,且所涉及的组合性质使其非平凡。近年来,已有一些算法通过利用 MNL 模型的特定性质而提出,但它们均分别估计 MNL 模型参数,且产生的后悔界不优于 O~(NT)\tilde{O}\big(\sqrt{NT}\big),这对于大候选集大小 NN 而言并非理想。本文考虑物品效用表示为 dd 维物品特征的线性函数的{\it 线性效用} MNL 选择模型,并提出名为 {\bf LUMB} 的算法以利用底层结构。证明所提算法达到 O~(dKT)\tilde{O}\big(dK\sqrt{T}\big) 后悔界,其与候选集大小无关。实验显示了所提算法的优越性。

关键词

引用

@article{arxiv.1805.02971,
  title  = {Multinomial Logit Bandit with Linear Utility Functions},
  author = {Mingdong Ou and Nan Li and Shenghuo Zhu and Rong Jin},
  journal= {arXiv preprint arXiv:1805.02971},
  year   = {2019}
}