中文

量子多臂老虎机与随机线性老虎机享有对数后悔界

机器学习 2022-05-31 v1 量子物理

摘要

多臂老虎机(MAB)和随机线性老虎机(SLB)是强化学习中的重要模型,且众所周知,具有时间范围 TT 的经典老虎机算法承受 Ω(T)\Omega(\sqrt{T}) 后悔。本文中,我们研究具有量子奖励预言机的MAB和SLB,并为两种模型提出具有 O(\mboxpoly(logT))O(\mbox{poly}(\log T)) 后悔的量子算法,对 TT 的依赖性实现了指数级改进。据我们所知,这是首个可证明的老虎机问题后悔以及一般而言强化学习中利用的量子加速。与先前关于MAB和强化学习的量子探索算法的文献相比,我们的量子输入模型更简单,且仅假设每个单独臂的量子预言机。

关键词

引用

@article{arxiv.2205.14988,
  title  = {Quantum Multi-Armed Bandits and Stochastic Linear Bandits Enjoy Logarithmic Regrets},
  author = {Zongqi Wan and Zhijie Zhang and Tongyang Li and Jialin Zhang and Xiaoming Sun},
  journal= {arXiv preprint arXiv:2205.14988},
  year   = {2022}
}

备注

14+6 pages