具有全反馈或部分线性反馈的组合纯探索
机器学习
2020-12-16 v2 机器学习
摘要
在本文中,我们首先研究了具有全反馈的组合纯探索(CPE-BL)问题,其中学习者被给定一个组合动作空间X ⊆ {0,1}^d,在每一轮中,学习者选择一个动作x ∈ X,并收到一个期望为x^T θ的随机奖励,其中θ ∈ R^d是一个潜在且未知的环境向量。目标是以尽可能少的样本识别出具有最高期望奖励的最优动作。对于CPE-BL,我们设计了第一个多项式时间自适应算法,其样本复杂度在一类实例上匹配下界(在对数因子内),并且对Δ_min(最优动作与次优动作之间的最小差距)的依赖性很轻。此外,我们提出了CPE-BL的一个新颖推广,称为具有部分线性反馈的组合纯探索(CPE-PL),它具有灵活的反馈结构,涵盖了包括全反馈、半反馈、部分反馈和非线性奖励函数在内的多个子问题族。在CPE-PL中,每次选择动作x会报告一个期望为M_x θ的随机反馈向量,其中M_x ∈ R^{m_x × d}是x的变换矩阵,并获得一个与x相关的随机(可能非线性的)奖励。对于CPE-PL,我们开发了第一个多项式时间算法,该算法同时解决了有限反馈、一般奖励函数和组合动作空间的问题,并提供了其样本复杂度分析。我们的实证评估表明,我们的算法运行速度比现有算法快几个数量级,并且我们的CPE-BL算法在不同的Δmin设置下具有鲁棒性,而我们的CPE-PL算法是唯一能为非线性奖励函数返回正确答案的算法。
引用
@article{arxiv.2006.07905,
title = {Combinatorial Pure Exploration with Full-Bandit or Partial Linear Feedback},
author = {Yihan Du and Yuko Kuroki and Wei Chen},
journal= {arXiv preprint arXiv:2006.07905},
year = {2020}
}
备注
AAAI2021