中文

基于动态电路量子比特复用与 Grover 优化的 NISQ 设备可扩展量子强化学习

量子物理 2026-04-23 v2 机器学习

摘要

本文提出了一种可扩展且资源高效的量子强化学习框架,消除了多步量子马尔可夫决策过程(QMDP)中线性量子比特扩展的障碍。该框架将 QMDP 公式、动态电路执行和基于 Grover 的振幅放大集成到一个统一的量子原生架构中。环境动力学完全编码在量子希尔伯特空间内,实现了对状态-动作序列的相干叠加,以及无需中间量子-经典转换的直接量子智能体-环境接口。核心贡献在于一种用于多步 QMDP 的动态执行模型,该模型采用电路中间测量和重置,在顺序交互中循环使用固定的物理量子寄存器。与静态展开的 QMDP 相比,这种方法保持了轨迹保真度,生成相同的状态-动作序列,同时将所需的物理量子比特数从 7xT 减少到常数 7,与交互时长 T 无关。因此,多步 QMDP 的量子比特复杂度从 O(T) 转变为 O(1),同时在轨迹生成层面保持功能等价。轨迹回报通过量子算术进行评估,高回报轨迹被标记并利用振幅放大来增加其采样概率。仿真结果证实了轨迹保真度的保持,且与静态设计相比,量子比特减少了 66%。在 IBM Heron 级处理器上的实验执行证明了在含噪中等规模量子硬件上的可行性,为大规模量子原生强化学习奠定了可扩展且资源高效的基础。

关键词

引用

@article{arxiv.2509.16002,
  title  = {Scalable Quantum Reinforcement Learning on NISQ Devices with Dynamic-Circuit Qubit Reuse and Grover Optimization},
  author = {Thet Htar Su and Shaswot Shresthamali and Masaaki Kondo},
  journal= {arXiv preprint arXiv:2509.16002},
  year   = {2026}
}