中文

具有通用奖励函数的组合多臂老虎机

机器学习 2018-07-23 v4 数据结构与算法 机器学习

摘要

在本文中,我们研究了随机组合多臂老虎机 (CMAB) 框架,该框架允许通用的非线性奖励函数,其期望值可能不仅取决于输入随机变量的均值,还可能取决于这些变量的整个分布。我们的框架启用了更大类的奖励函数,例如 max()\max() 函数和非线性效用函数。现有的依赖于随机变量均值精确估计的技术(如上置信界 (UCB) 技术)无法直接适用于这些函数。我们提出了一种名为随机占优置信界 (SDCB) 的新算法,该算法估计底层随机变量的分布及其随机占优置信界。我们证明了 SDCB 可以实现 O(logT)O(\log{T}) 的分布相关遗憾和 O~(T)\tilde{O}(\sqrt{T}) 的分布无关遗憾,其中 TT 是时间视界。我们将结果应用于 KK-MAX 问题和期望效用最大化问题。特别是对于 KK-MAX,我们为其离线问题提供了首个多项式时间近似方案 (PTAS),并为其在线问题的 (1ϵ)(1-\epsilon)-近似遗憾给出了首个 O~(T)\tilde{O}(\sqrt T) 界,适用于任意 ϵ>0\epsilon>0

关键词

引用

@article{arxiv.1610.06603,
  title  = {Combinatorial Multi-Armed Bandit with General Reward Functions},
  author = {Wei Chen and Wei Hu and Fu Li and Jian Li and Yu Liu and Pinyan Lu},
  journal= {arXiv preprint arXiv:1610.06603},
  year   = {2018}
}

备注

Published in Neural Information Processing Systems (NIPS) 2016. New in this version: a minor bug fix