具有通用奖励函数的组合多臂老虎机
机器学习
2018-07-23 v4 数据结构与算法
机器学习
摘要
在本文中,我们研究了随机组合多臂老虎机 (CMAB) 框架,该框架允许通用的非线性奖励函数,其期望值可能不仅取决于输入随机变量的均值,还可能取决于这些变量的整个分布。我们的框架启用了更大类的奖励函数,例如 函数和非线性效用函数。现有的依赖于随机变量均值精确估计的技术(如上置信界 (UCB) 技术)无法直接适用于这些函数。我们提出了一种名为随机占优置信界 (SDCB) 的新算法,该算法估计底层随机变量的分布及其随机占优置信界。我们证明了 SDCB 可以实现 的分布相关遗憾和 的分布无关遗憾,其中 是时间视界。我们将结果应用于 -MAX 问题和期望效用最大化问题。特别是对于 -MAX,我们为其离线问题提供了首个多项式时间近似方案 (PTAS),并为其在线问题的 -近似遗憾给出了首个 界,适用于任意 。
引用
@article{arxiv.1610.06603,
title = {Combinatorial Multi-Armed Bandit with General Reward Functions},
author = {Wei Chen and Wei Hu and Fu Li and Jian Li and Yu Liu and Pinyan Lu},
journal= {arXiv preprint arXiv:1610.06603},
year = {2018}
}
备注
Published in Neural Information Processing Systems (NIPS) 2016. New in this version: a minor bug fix