中文

量子重尾多臂赌博机

机器学习 2023-01-25 v1 人工智能

摘要

本文研究了具有重尾奖励和量子奖励预言机的多臂赌博机(MAB)与随机线性赌博机(SLB)。不同于先前量子赌博机工作所假设的有界/次高斯奖励分布,此处我们在更弱的假设下研究量子赌博机问题,即奖励分布仅对某些 v(0,1]v\in (0,1] 具有有界的 (1+v)(1+v) 阶矩。为实现重尾赌博机的后悔值改进,我们首先提出了一种针对重尾分布的新型量子均值估计器,其基于量子蒙特卡洛均值估计器,相较经典估计器实现了估计误差的二次方改进。基于我们的量子均值估计器,我们聚焦于量子重尾 MAB 与 SLB,并针对这两个问题基于上置信界(UCB)框架提出量子算法,其后悔值为 \TildeO(T1v1+v)\Tilde{O}(T^{\frac{1-v}{1+v}}),相较于经典的(近)最优后悔值 \TildeO(T11+v)\Tilde{O}(T^{\frac{1}{1+v}})TT 为轮数)在 TT 的依赖上实现了多项式级改进。最后,实验也支持了我们的理论结果并展示了所提方法的有效性。

关键词

引用

@article{arxiv.2301.09680,
  title  = {Quantum Heavy-tailed Bandits},
  author = {Yulian Wu and Chaowen Guan and Vaneet Aggarwal and Di Wang},
  journal= {arXiv preprint arXiv:2301.09680},
  year   = {2023}
}

备注

Online learning; Quantum machine learning