中文

组合式多目标多臂老虎机问题

机器学习 2018-03-13 v1

摘要

在本文中,我们引入了组合式多目标多臂老虎机(COmbinatorial Multi-Objective Multi-Armed Bandit,COMO-MAB)问题,该问题同时刻画了组合式与多目标在线学习的挑战。在此设定下,学习者的目标是在每个时刻选择一个动作,其奖励向量是该动作中各个臂的奖励向量的线性组合,以学习超帕累托最优动作集合,该集合包含帕累托最优动作以及在期望奖励向量上任意加上一个小的正数后变为帕累托最优的动作。我们定义了帕累托遗憾性能指标,并提出了一种公平学习算法,其帕累托遗憾为 O(NL3logT)O(N L^3 \log T),其中 TT 为时间范围,NN 为臂的数量,LL 为一个动作中臂的最大数量。我们展示了 COMO-MAB 具有广泛的应用,包括向用户推荐物品捆绑包和网络路由,并聚焦于存在多维性能指标的多用户通信中的资源分配应用,其中我们表明我们的算法优于现有的 MAB 算法。

关键词

引用

@article{arxiv.1803.04039,
  title  = {Combinatorial Multi-Objective Multi-Armed Bandit Problem},
  author = {Doruk Öner and Altuğ Karakurt and Atilla Eryılmaz and Cem Tekin},
  journal= {arXiv preprint arXiv:1803.04039},
  year   = {2018}
}