中文

基于数据重上传的 VQC 强化学习:性能与可训练性

量子物理 2024-11-13 v2 机器学习

摘要

强化学习(RL)旨在设计无需人类监督即可做出智能决策的智能体。当与神经网络(NNs)等函数逼近器结合使用时,RL 能够解决极其复杂的问题。深度 Q 学习作为一种使用深度 NNs 的 RL 算法,在某些特定任务中取得了超越人类的表现。尽管如此,变分量子线路也可以用作 RL 算法中的函数逼近器。本工作在经典控制基准环境中实证研究了此类基于 VQC 的深度 Q 学习模型的性能与可训练性。更具体地,我们研究了数据重上传如何影响这两个指标。我们表明,由于深度 Q 学习的移动目标,这些模型梯度的量级与方差在整个训练过程中保持显著。此外,我们实证表明,对于逼近 2-设计的参数化量子线路(PQC),增加量子比特数并不会导致梯度量级与方差呈指数衰减行为,这与基于贫瘠高原现象所预期的不同。这暗示了 VQC 特别适合在此类背景下用作函数逼近器。

关键词

引用

@article{arxiv.2401.11555,
  title  = {VQC-Based Reinforcement Learning with Data Re-uploading: Performance and Trainability},
  author = {Rodrigo Coelho and André Sequeira and Luís Paulo Santos},
  journal= {arXiv preprint arXiv:2401.11555},
  year   = {2024}
}

备注

26 pages, 11 figures