中文

上下文连续臂赌博机的一种无维数算法

机器学习 2022-10-05 v3 机器学习

摘要

在上下文连续臂赌博机中,上下文 xx 与臂 yy 均为连续变量且取自高维空间。待学习的收益函数 f(x,y)f(x,y) 不具有特定的参数形式。已有文献表明,对于 Lipschitz 连续函数,最优后悔界为 O~(Tdx+dy+1dx+dy+2)\tilde{O}(T^{\frac{d_x+d_y+1}{d_x+d_y+2}}),其中 dxd_xdyd_y 分别为上下文与臂的维数,因而遭受维数灾难。我们开发了一种算法,当 ff 关于 yy 全局凹时达到后悔界 O~(Tdx+1dx+2)\tilde{O}(T^{\frac{d_x+1}{d_x+2}})。全局凹性在许多应用中是常见假设。该算法基于随机逼近并以在线方式估计梯度信息。我们的结果给出了一个有价值的见解:臂的维数灾难可借由收益函数的某些温和结构加以克服。

关键词

引用

@article{arxiv.1907.06550,
  title  = {A Dimension-free Algorithm for Contextual Continuum-armed Bandits},
  author = {Wenhao Li and Ningyuan Chen and L. Jeff Hong},
  journal= {arXiv preprint arXiv:1907.06550},
  year   = {2022}
}