量子策略梯度流程中时间表达性与可训练性估计的互信息度量
量子物理
2026-03-10 v2
摘要
近年来,传统监督学习的各种局限性已被识别,推动了强化学习——以及利用纠缠和叠加等量子资源的量子强化学习的发展。在各种强化学习方法中,策略梯度方法被认为具有诸多益处;例如,它允许智能体在无需显式知晓环境的关键信息(如状态转移概率和初始状态分布)的情况下进行学习。同时,从学习的角度来看,两个指标通常被认为是重要的:表达性和可训练性(对于基于梯度的方法)。尽管已有许多尝试来量化神经网络模型和参数化量子电路(PQC)的表达性和可训练性,但尽管传统监督学习与强化学习之间存在固有差异,目前仍缺乏适用于强化学习环境的明确方法。因此,在本研究中,我们提出将表达性的概念修正为适合强化学习动力学的时间表达性,并表明动作分布与离散化奖励信号之间的互信息为缩放梯度范数提供了上界,同时为所提出的时间表达性度量给出了信息论分解和残差感知上界。最后,在明确的集中假设下,我们表明 MI-TET 为 PQC 架构间初始化时的梯度脆弱性引入了一个基于假设的、单侧的预筛选准则。
引用
@article{arxiv.2512.05157,
title = {A Mutual Information-based Metric for Temporal Expressivity and Trainability Estimation in Quantum Policy Gradient Pipelines},
author = {Jaehun Jeong and Donghwa Ji and Kabgyun Jeong},
journal= {arXiv preprint arXiv:2512.05157},
year = {2026}
}
备注
22 pages, 8 figures