中文

基于非参数变量选择的上下文在线学习降维

机器学习 2022-10-04 v2 机器学习

摘要

我们考虑一个具有高维协变量x与决策y的上下文在线学习(多臂bandit)问题。待学习的奖励函数f(x,y)不具有特定参数形式。文献已表明最优regret为Õ(T^{(d_x+d_y+1)/(d_x+d_y+2)}),其中d_x与d_y为x与y的维度,因此受维数灾难影响。在许多应用中,协变量中仅一小部分变量影响f的值,统计中称之为稀疏性。为利用协变量的稀疏结构,我们提出一种称为BV-LASSO的变量选择算法,其结合分箱与投票等新思想将LASSO应用于非参数设定。我们的算法达到regret Õ(T^{(d_x^*+d_y+1)/(d_x^*+d_y+2)}),其中d_x^*为有效协变量维度。该regret与协变量为d^*_x维时的最优regret匹配,故无法改进。我们的算法可作为在非参数设定中通过变量选择实现降维的通用方法。

关键词

引用

@article{arxiv.2009.08265,
  title  = {Dimension Reduction in Contextual Online Learning via Nonparametric Variable Selection},
  author = {Wenhao Li and Ningyuan Chen and L. Jeff Hong},
  journal= {arXiv preprint arXiv:2009.08265},
  year   = {2022}
}