中文

带有控制变量的随机多臂老虎机

机器学习 2022-01-19 v3 人工智能 机器学习

摘要

本文研究了一类新的随机多臂老虎机问题变体,其中关于臂收益的辅助信息以控制变量的形式给出。在排队和无线网络等许多应用中,臂收益是某些外生变量的函数。这些变量的均值根据历史数据先验已知,可用作控制变量。借助控制变量理论,我们获得了方差更小、置信界更紧的均值估计。我们开发了一种基于上置信界、名为 UCB-CV 的算法,并在收益与控制变量服从多元正态分布时给出了关于二者相关性的后悔界刻画。我们还利用 Jackknifing 和 Splitting 等重采样方法将 UCB-CV 扩展到其他分布。在合成问题实例上的实验验证了所提算法的性能保证。

关键词

引用

@article{arxiv.2105.03962,
  title  = {Stochastic Multi-Armed Bandits with Control Variates},
  author = {Arun Verma and Manjesh K. Hanawal},
  journal= {arXiv preprint arXiv:2105.03962},
  year   = {2022}
}

备注

Accepted to NeurIPS 2021