无限 horizon 平均奖励马尔可夫决策过程后悔分析中的量子加速
机器学习
2025-05-28 v4 人工智能
量子物理
摘要
本文研究了量子加速在解决无限 horizon 马尔可夫决策过程(MDPs)以提升平均奖励结果方面的潜力。我们为智能体与未知 MDP 的交互引入了一种创新的量子框架,扩展了传统的交互范式。我们的方法涉及设计一种乐观驱动的表格强化学习算法,该算法利用智能体通过高效量子均值估计技术获取的量子信号。通过深入的理论分析,我们证明了均值估计中的量子优势带来了无限 horizon 强化学习后悔保证的指数级提升。具体而言,所提出的量子算法实现了 的后悔界,相较经典对应算法所展现的 界有显著改进。
引用
@article{arxiv.2310.11684,
title = {Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes},
author = {Bhargav Ganguly and Yang Xu and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2310.11684},
year = {2025}
}