强化学习用于参数化量子态准备:比较研究
机器学习
2026-02-19 v1 量子物理
摘要
我们将有向量子电路合成(DQCS)从纯离散门选择扩展到参数化量子态准备,涉及连续单量子比特旋转 、 和 。我们比较了两种训练模式:一种是联合选择门类型、受影响量子比特及旋转角度的一级智能体;另一种是两阶段方法,先提议离散电路,再使用基于参数位移梯度的 Adam 优化旋转角度。使用 Gymnasium 和 PennyLane,我们在包含两至十个量子比特的系统上评估了近端策略优化(PPO)和优势演员-评论家(A2C),目标复杂度 范围为一至五。虽然 A2C 在此设置下未能学习有效策略,但 PPO 在稳定超参数下成功实现(一阶段:学习率约为 ,自保真度误差阈值为 0.01;两阶段:学习率约为 )。两种方法可靠地重建计算基态(成功率 83% 至 99%)和贝尔态(成功率 61% 至 77%)。然而,随着 约为三至四时可扩展性饱和,即使在 时也无法扩展到十量子比特目标。两阶段方法仅提供约三倍运行时间的边际精度提升。因此,在固定计算预算下,我们推荐使用一阶段 PPO 策略,提供明确的合成电路,并与经典变分基线进行对比,以勾勒提高可扩展性的 avenues。
引用
@article{arxiv.2602.16523,
title = {Reinforcement Learning for Parameterized Quantum State Preparation: A Comparative Study},
author = {Gerhard Stenzel and Isabella Debelic and Michael Kölle and Tobias Rohe and Leo Sünkel and Julian Hager and Claudia Linnhoff-Popien},
journal= {arXiv preprint arXiv:2602.16523},
year = {2026}
}
备注
Extended version of a short paper to be published at ICAART 2026