中文

高维在线决策中相关性的利用

机器学习 2020-12-29 v2 机器学习

摘要

许多序贯决策任务要求在每一步决策时,从高维数据流中提取可操作的智能,从海量可能中选择正确的动作。大多数时候,动作和数据的高度维度使得传统学习方法难以学习最优动作。在本工作中,我们研究如何发现并利用动作和数据中的稀疏性以实现快速学习。作为学习模型,我们考虑一个结构化的上下文多臂老虎机 (CMAB),其具有高维臂(动作)和上下文(数据)集合,其中奖励仅依赖于联合上下文-臂集合中的少数相关维度,且可能以非线性方式依赖。我们偏离先前工作,假设高维、连续的臂集合,并允许相关上下文维度随每个臂变化。我们提出一种称为上下文多臂老虎机与相关学习 (CMAB-RL) 的新在线学习算法,并证明其时间平均遗憾在奖励随上下文和臂平滑变化时可渐近趋于零。CMAB-RL 相比经典 CMAB 算法享有显著改善的遗憾界,后者的遗憾依赖于上下文和臂集合的维度 dxd_xdad_a。重要的是,我们表明当学习器具有关于稀疏性的先验知识(以相关维度数的上界 dx\overline{d}_xda\overline{d}_a 给出)时,CMAB-RL 达到 O~(T11/(2+2dx+da))\tilde{O}(T^{1-1/(2+2\overline{d}_x +\overline{d}_a)}) 遗憾。最后,我们说明了 CMAB 算法如何用于 1 型糖尿病患者的最优个性化血糖控制,并展示在此任务中 CMAB-RL 优于其他上下文 MAB 算法。

关键词

引用

@article{arxiv.1907.00783,
  title  = {Exploiting Relevance for Online Decision-Making in High-Dimensions},
  author = {Eralp Turgay and Cem Bulucu and Cem Tekin},
  journal= {arXiv preprint arXiv:1907.00783},
  year   = {2020}
}

备注

Accepted for publication in IEEE Transactions on Signal Processing