上下文连续臂赌博机的一种无维数算法
机器学习
2022-10-05 v3 机器学习
摘要
在上下文连续臂赌博机中,上下文 与臂 均为连续变量且取自高维空间。待学习的收益函数 不具有特定的参数形式。已有文献表明,对于 Lipschitz 连续函数,最优后悔界为 ,其中 与 分别为上下文与臂的维数,因而遭受维数灾难。我们开发了一种算法,当 关于 全局凹时达到后悔界 。全局凹性在许多应用中是常见假设。该算法基于随机逼近并以在线方式估计梯度信息。我们的结果给出了一个有价值的见解:臂的维数灾难可借由收益函数的某些温和结构加以克服。
引用
@article{arxiv.1907.06550,
title = {A Dimension-free Algorithm for Contextual Continuum-armed Bandits},
author = {Wenhao Li and Ningyuan Chen and L. Jeff Hong},
journal= {arXiv preprint arXiv:1907.06550},
year = {2022}
}