中文

具有连续可分离奖励函数的组合纯探索及其运用(扩展版)

机器学习 2018-05-07 v1 机器学习

摘要

我们在随机多臂老虎机设定下研究具有连续可分离奖励函数(CPE-CS)的组合纯探索问题。在一个 CPE-CS 实例中,给定若干具有未知分布的随机臂,以及一组可能决策。每个决策依据各臂分布有一个奖励。目标是以尽可能少的臂样本辨识出具有最大奖励的决策。该问题推广了近年来受到显著关注的有线性奖励的组合纯探索问题。本文中,我们提出一种针对 CPE-CS 问题的自适应学习算法,并分析其样本复杂度。特别地,我们引入称为一致最优性硬度的新硬度度量,并给出样本复杂度的上下界。此外,我们给出示例以表明我们的解有能力处理非线性奖励函数。

关键词

引用

@article{arxiv.1805.01685,
  title  = {Combinatorial Pure Exploration with Continuous and Separable Reward Functions and Its Applications (Extended Version)},
  author = {Weiran Huang and Jungseul Ok and Liang Li and Wei Chen},
  journal= {arXiv preprint arXiv:1805.01685},
  year   = {2018}
}

备注

conference version accepted by IJCAI-ECAI-18