热启动变分量子策略迭代
量子物理
2025-01-15 v2 机器学习
摘要
强化学习是一个强大的框架,旨在确定高度复杂决策场景中的最优行为。这一目标可以通过策略迭代实现,这需要求解一个通常很大的线性方程组。我们提出了变分量子策略迭代(VarQPI)算法,利用NISQ兼容的量子增强子程序实现这一步骤。其可扩展性得到了对通用强化学习环境结构分析的支持,为在实用规模的量子计算机上实现潜在量子优势奠定了基础。此外,我们引入了热启动初始化变体(WS-VarQPI),显著减少了资源开销。该算法解决了一个大型的FrozenLake环境,其底层为256x256维线性系统,表明了其实用鲁棒性。
引用
@article{arxiv.2404.10546,
title = {Warm-Start Variational Quantum Policy Iteration},
author = {Nico Meyer and Jakob Murauer and Alexander Popov and Christian Ufrecht and Axel Plinge and Christopher Mutschler and Daniel D. Scherer},
journal= {arXiv preprint arXiv:2404.10546},
year = {2025}
}
备注
Accepted to the IEEE International Conference on Quantum Computing and Engineering (QCE 2024), Montr\'eal, Qu\'ebec, Canada. 9 pages, 6 figures, 1 table