中文

无限 horizon 平均奖励马尔可夫决策过程后悔分析中的量子加速

机器学习 2025-05-28 v4 人工智能 量子物理

摘要

本文研究了量子加速在解决无限 horizon 马尔可夫决策过程(MDPs)以提升平均奖励结果方面的潜力。我们为智能体与未知 MDP 的交互引入了一种创新的量子框架,扩展了传统的交互范式。我们的方法涉及设计一种乐观驱动的表格强化学习算法,该算法利用智能体通过高效量子均值估计技术获取的量子信号。通过深入的理论分析,我们证明了均值估计中的量子优势带来了无限 horizon 强化学习后悔保证的指数级提升。具体而言,所提出的量子算法实现了 O~(1)\tilde{\mathcal{O}}(1) 的后悔界,相较经典对应算法所展现的 O~(T)\tilde{\mathcal{O}}(\sqrt{T}) 界有显著改进。

关键词

引用

@article{arxiv.2310.11684,
  title  = {Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes},
  author = {Bhargav Ganguly and Yang Xu and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2310.11684},
  year   = {2025}
}