中文

基于分析可解单位控制-测量模型的量子强化学习中的复杂度规模与最优政策退化

综合数学 2026-04-16 v1

摘要

我们提出并分析了一类量子强化学习(QRL)的可分析可解模型,将其表述为有限时域的哈姆里德决策过程,处于有限维希尔伯特空间中。该模型围绕一种“单位控制-后测量”协议构建,其中学习智能体对量子态施加单位变换,并在每个控制步骤后依据指定参考基进行投影测量。推导了四个具体实现的轨迹概率、奖励和预期回报的闭式解析表达式:一种闭环和一种反周期的 qubit 实现,一个带有梯子耦合的 qutrit 模型,以及一个四能级双 qubit 系统。严格分析了这些 QRL 协议的两个结构特征。首先,我们识别并量化了预期回报计算复杂度的两种层次的降低:从轨迹长度 NN 上的指数级 O(eN)O(e^N) 缩减为显式幂律 O(NI)O(N^{\mathcal{I}}):一种源于轨迹层次,源自于共享相同无序状态计数和转换频率的路径等价类;另一种源于政策层次,源于受约束单位操作强制的转换图稀疏性。其次,我们描述了最优政策的退化。低维模型表现出唯一的最优解,其渐近行为随 NN 受量子 Zeno 效应支配;而四能级系统显示在大范围内的平台型准退化以及在临界能参数处的真实离散退化——这些现象在无测量的量子最优控制景观中无对应物。

关键词

引用

@article{arxiv.2604.13096,
  title  = {Complexity scaling and optimal policy degeneracy in quantum reinforcement learning via analytically solvable unitary-control-then-measure models},
  author = {Andrea Cintio and Alessandro Michelangeli and Dmitrii Tsutskov},
  journal= {arXiv preprint arXiv:2604.13096},
  year   = {2026}
}