QuantFPFlow:基于量子幅度估计的 Fokker--Planck 策略优化
机器学习
2026-05-19 v1 人工智能
摘要
我们引入 \textbf{QuantFPFlow},一种将量子幅度估计集成到 Fokker--Planck(FP)随机策略优化框架中的强化学习方法。经典的连续空间 RL 代理必须以 的复杂度估计 FP 分区函数 ;QuantFPFlow 用 Grover 放大幅度估计器实现 ——可实现的二次加速。虽然完整的量子加速需要容错硬件,但本文演示的量子灵感经典仿真已展现 的算法结构。估计得到的平稳分布 驱动一个理论上有据可依的探索奖励 。该奖励引导代理前往多模态奖励景观中全局最优区域,同时通过 FP 扩散匹配约束策略方差。在一个特别设计以暴露局部最优失效的连续控制任务上,QuantFPFlow 实现均值奖励 ,而 SAC 为 ,同时发现全局最优 \textbf{以 10.4\% 更高频率}(33.9\% vs.\ 30.7\%)。策略熵在训练期间保持在 nat 左右,而 SAC 降至 nat,证明 FP 扩散匹配主动防止早期收敛。在维度实验中,QuantFPFlow 的计算规模为 ,而经典 FP 估计为 。
引用
@article{arxiv.2605.16429,
title = {QuantFPFlow: Quantum Amplitude Estimation for Fokker--Planck Policy Optimisation in Continuous Reinforcement Learning},
author = {Abraham Itzhak Weinberg},
journal= {arXiv preprint arXiv:2605.16429},
year = {2026}
}