中文

ORBIT-Q:科学量子编程中自主代理的双轴基准测试

量子物理 2026-07-03 v1

摘要

自主编码代理在许多常规编程任务上表现良好,但科学计算要求一个严格的验证范式,该范式超越简单的功能测试完成:生成的代码必须保持物理可区分性、可微分工作流、框架本征语义和可扩展表示。我们引入了量子计算中集成任务的开放研究基准(ORBIT-Q)以填补这一空白。在其核心,ORBIT-Q 提供了一个精心策划的复杂、研究级别的量子工作流套件,作为现代科学编程的挑战性测试台。ORBIT-Q 结合了一个严格的层级验证管道,以支持两种正交比较:在固定量子软件框架下不同的代理 harness 和模型配置,以及在固定代理下不同的量子软件框架。在系统评估中,TensorCircuit-NG(TC)在代理驱动编程下评估的量子软件框架中表现出最高的能力和性能效率,而 Codex 与 GPT-5.5 在 TC 上是测试最强的代理配置。然而,前沿自主代理与人类专家参考实现之间仍存在显著的性能和设计差距。我们进一步评估了两个效率维度:代理侧资源使用和产物侧运行时。这些结果共同确立了 ORBIT-Q 作为自主科学编程、框架-代理协同和量子软件性能的可信基准。

关键词

引用

@article{arxiv.2607.03105,
  title  = {ORBIT-Q: Dual-axis benchmarking of autonomous agents in scientific quantum programming},
  author = {Shi-Xin Zhang and Yu-Qin Chen},
  journal= {arXiv preprint arXiv:2607.03105},
  year   = {2026}
}

备注

7.5 pages, 4 figures with references and supplementary information