中文

RubriQ:面向约束感知量子电路合成的准则引导群组相对策略优化

量子物理 2026-07-08 v1

摘要

设计既算法正确又硬件兼容的容错量子电路,仍然是向可扩展量子计算过渡的主要瓶颈。我们引入了 RubriQ,这是一个可扩展的框架,将电路合成表述为大语言模型 (LLM) 代码生成任务,并通过群组相对策略优化 (GRPO) 进行优化。与传统的黑盒神经评论家不同,RubriQ 采用基于领域的程序化准则作为强化学习奖励函数,从 T 门减少、硬件拓扑合规性和酉保真度方面对电路进行评估。为了支持高吞吐量训练,RubriQ 将 GPU 加速的 CUDA-Q 仿真直接集成到强化学习 (RL) 循环中,并使用 DeepSpeed ZeRO2 部署在跨多节点 NVIDIA A100 集群的 NERSC Perlmutter 上。在基准任务上,RubriQ 实现了 3.31 倍的平均 T 门压缩,显著优于稀疏奖励强化学习基线 (2.05 倍),收敛速度快 2-3 倍,并保持低于 1% 的硬件约束违规率。在 IBM 和 IonQ 量子处理器上得到验证,RubriQ 建立了一个自动化、高性能计算 (HPC) 驱动的流水线,用于大规模生成硬件就绪的容错量子电路。

关键词

引用

@article{arxiv.2607.07554,
  title  = {RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis},
  author = {Ziqing Guo and Ziwen Pan},
  journal= {arXiv preprint arXiv:2607.07554},
  year   = {2026}
}