中文

以山地车问题为例的量子增强策略迭代

量子物理 2023-08-17 v1

摘要

近年来,量子处理器的实验演示进展引发了对量子计算实际实现理念的广泛兴趣。预计量子算法的使用将显著加速数值优化和机器学习中某些问题的求解。在本文中,我们提出一种量子增强策略迭代 (QEPI) 算法,该算法在强化学习领域被广泛使用,并以山地车问题为重点进行验证。在实践中,我们详细阐述了值迭代算法的软版本,其有益于策略解释,并针对 QEPI 的目的讨论了连续状态强化学习问题中的随机离散化技术。分析了算法在稠密和(典型的)稀疏情形下的复杂度。以山地车为例、使用量子模拟器的数值结果验证了所开发的流程并基准测试了 QEPI 的性能。

关键词

引用

@article{arxiv.2308.08348,
  title  = {Quantum-enhanced policy iteration on the example of a mountain car},
  author = {Egor E. Nuzhin and Dmitry Yudin},
  journal= {arXiv preprint arXiv:2308.08348},
  year   = {2023}
}

备注

12 pages, 7 figures