中文

QuantFPFlow:基于量子幅度估计的 Fokker--Planck 策略优化

机器学习 2026-05-19 v1 人工智能

摘要

我们引入 \textbf{QuantFPFlow},一种将量子幅度估计集成到 Fokker--Planck(FP)随机策略优化框架中的强化学习方法。经典的连续空间 RL 代理必须以 \calO(1/ε2)\calO(1/\varepsilon^{2}) 的复杂度估计 FP 分区函数 Z=eV(x)/DdxZ = \int e^{-V(\mathbf{x})/D}\,d\mathbf{x};QuantFPFlow 用 Grover 放大幅度估计器实现 \calO(1/ε)\calO(1/\varepsilon)——可实现的二次加速。虽然完整的量子加速需要容错硬件,但本文演示的量子灵感经典仿真已展现 \calO(1/ε)\calO(1/\varepsilon) 的算法结构。估计得到的平稳分布 \rhostar\rhostar 驱动一个理论上有据可依的探索奖励 \Raug=\Renv+αlog(1/\rhostar(s))\Raug = \Renv + \alpha\log(1/\rhostar(s))。该奖励引导代理前往多模态奖励景观中全局最优区域,同时通过 FP 扩散匹配约束策略方差。在一个特别设计以暴露局部最优失效的连续控制任务上,QuantFPFlow 实现均值奖励 1,295.7±423.21{,}295.7 \pm 423.2,而 SAC 为 1,284.0±474.01{,}284.0 \pm 474.0,同时发现全局最优 \textbf{以 10.4\% 更高频率}(33.9\% vs.\ 30.7\%)。策略熵在训练期间保持在 H(π)6.5H(\pi)\approx 6.5 nat 左右,而 SAC 降至 1.51.5 nat,证明 FP 扩散匹配主动防止早期收敛。在维度实验中,QuantFPFlow 的计算规模为 \calO(d0.35)\calO(d^{0.35}),而经典 FP 估计为 \calO(d0.76)\calO(d^{0.76})

关键词

引用

@article{arxiv.2605.16429,
  title  = {QuantFPFlow: Quantum Amplitude Estimation for Fokker--Planck Policy Optimisation in Continuous Reinforcement Learning},
  author = {Abraham Itzhak Weinberg},
  journal= {arXiv preprint arXiv:2605.16429},
  year   = {2026}
}