基于振幅估计与 Grover 搜索的量子策略迭代——迈向强化学习的量子优势
量子物理
2023-11-10 v2 机器学习
摘要
我们给出一种新型量子强化学习方法之完整实现与仿真。我们的工作是如何利用量子算法求解强化学习问题的详细且形式化的概念验证,并表明在可获得无误差、高效的智能体与环境量子实现时,量子方法相较经典基于蒙特卡洛的方法在样本复杂度上可获可证明改进。我们的方法详述了如何将振幅估计与 Grover 搜索组合为策略评估与改进方案。我们首先发展量子策略评估(QPE),其相较类似经典蒙特卡洛估计有二次效率提升,且基于有限马尔可夫决策过程(MDP)的量子力学实现。基于 QPE,我们导出量子策略迭代,利用 Grover 搜索反复改进初始策略直至达到最优。最后,我们给出针对双臂赌博机 MDP 的算法实现并随之仿真。
引用
@article{arxiv.2206.04741,
title = {Quantum Policy Iteration via Amplitude Estimation and Grover Search -- Towards Quantum Advantage for Reinforcement Learning},
author = {Simon Wiedemann and Daniel Hein and Steffen Udluft and Christian Mendl},
journal= {arXiv preprint arXiv:2206.04741},
year = {2023}
}