中文

一种自由度即便如金:基于生成模型的经典与量子强化学习算法

机器学习 2025-08-12 v2 人工智能 最优化与控制 量子物理 机器学习

摘要

我们提出了 novel 的经典和量子在线算法,用于学习有限时序和无限时序平均奖励马尔可夫决策过程(MDPs)。我们的算法基于混合探索-生成式强化学习(RL)模型,其中智能体可以定期以生成式抽样方式与环境交互,即通过访问“模拟器”。通过运用已知的经典和新的量子算法来逼近最优策略于生成模型之内,我们展示了可能避免RL中若干范式(如“面对不确定性的乐观主义”和“后验抽样”),并直接计算和使用最优策略,从而实现比以往工作更好的报酬下界。对于有限时序 MDPs,我们的量子算法获得的报酬下界仅依赖于时间步数 T 的对数,从而突破经典的 O(√T) 限制。这与 Ganguly 等人(arXiv'23)和 Zhong 等人(ICML'24)的先前量子作品在时间依赖性上的匹配,但在其他参数如状态空间大小 S 和动作空间大小 A 的依赖性方面有所改进。对于无限时序 MDPs,我们的经典和量子下界仍维持 O(√T) 的依赖,但在 S 和 A 的因子方面更好。尽管如此,我们提出了一种针对无限时序 MDPs 的新型报酬度量,基于此度量,我们的量子算法具有 poly log T 的报酬,显著优于经典算法。最后,我们将所有结果推广到紧凑状态空间。

关键词

引用

@article{arxiv.2507.22854,
  title  = {A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model},
  author = {Andris Ambainis and Joao F. Doriguello and Debbie Lim},
  journal= {arXiv preprint arXiv:2507.22854},
  year   = {2025}
}

备注

57 pages. v2: corrected a small typo in the statement of Result 1 and added references