具有线性效用函数的多项 Logit 赌博机
机器学习
2019-03-05 v2 人工智能
机器学习
摘要
多项 logit 赌博机是一类出现在诸多应用中的序贯子集选择问题。每轮中,玩家从 个候选物品中选择一个 基数的子集,并获得由{\it 多项 logit}(MNL)选择模型决定的奖励,该模型同时考虑物品效用及物品间替代性质。玩家的目标是在有限时域 内动态学习 MNL 模型参数并最大化累积奖励。该问题面临探索-利用困境,且所涉及的组合性质使其非平凡。近年来,已有一些算法通过利用 MNL 模型的特定性质而提出,但它们均分别估计 MNL 模型参数,且产生的后悔界不优于 ,这对于大候选集大小 而言并非理想。本文考虑物品效用表示为 维物品特征的线性函数的{\it 线性效用} MNL 选择模型,并提出名为 {\bf LUMB} 的算法以利用底层结构。证明所提算法达到 后悔界,其与候选集大小无关。实验显示了所提算法的优越性。
引用
@article{arxiv.1805.02971,
title = {Multinomial Logit Bandit with Linear Utility Functions},
author = {Mingdong Ou and Nan Li and Shenghuo Zhu and Rong Jin},
journal= {arXiv preprint arXiv:1805.02971},
year = {2019}
}