中文

用于 CERN 束流线的量子强化学习混合 actor-critic 算法

量子物理 2024-03-05 v1

摘要

基于自由能的强化学习(FERL)结合钳位量子玻尔兹曼机(QBM)被证明相比经典 Q-learning 能显著提升学习效率,但其限制在于仅适用于离散状态-动作空间环境。本文将 FERL 方法推广到多维连续状态-动作空间环境,从而为更广泛的实际应用打开大门。首先,研究了针对离散动作空间但连续状态空间的基于自由能的 Q-learning,并评估了经验回放对样本效率的影响。第二步,基于深度确定性策略梯度算法,结合经典 actor 网络与基于 QBM 的 critic,开发了面向连续状态-动作空间的混合 actor-critic 方案。讨论了使用量子退火(包括模拟与 D-Wave 量子退火硬件)所得结果,并将其性能与经典强化学习方法进行比较。全文所用环境均代表欧洲核子研究组织(CERN)现有的粒子加速器束流线。其中,混合 actor-critic 智能体还在先进等离子体尾场实验(AWAKE)的实际电子束流线上进行了评估。

关键词

引用

@article{arxiv.2209.11044,
  title  = {Hybrid actor-critic algorithm for quantum reinforcement learning at CERN beam lines},
  author = {Michael Schenk and Elías F. Combarro and Michele Grossi and Verena Kain and Kevin Shing Bruce Li and Mircea-Marian Popa and Sofia Vallecorsa},
  journal= {arXiv preprint arXiv:2209.11044},
  year   = {2024}
}

备注

17 pages, 15 figures, to be submitted to "Quantum" journal