可证明且实用的高效神经上下文_bandit
机器学习
2022-06-02 v1 机器学习
摘要
我们考虑神经上下文_bandit问题。与现有主要聚焦于ReLU神经网络的工作不同,我们考虑一组通用的光滑激活函数。在这一更通用的设定下,(i) 我们推导了过参数化神经网络与其对应神经切线核之间差异的非渐近误差界,(ii) 我们提出了一种具有可证明次线性后悔界且在有限样本机制下也高效的算法,实证研究表明了这一点。该非渐近误差界具有更广泛的意义,可作为建立神经上下文_bandit中激活函数光滑性与核_bandit中核光滑性之间关系的工具。
引用
@article{arxiv.2206.00099,
title = {Provably and Practically Efficient Neural Contextual Bandits},
author = {Sudeep Salgia and Sattar Vakili and Qing Zhao},
journal= {arXiv preprint arXiv:2206.00099},
year = {2022}
}