中文

量子神经网络中的Grokking与逐轮双下降现象

量子物理 2026-07-09 v1 数据分析、统计与概率

摘要

Grokking,即从记忆到泛化的延迟转变,是基于梯度的学习中的一个基本现象,然而其在变分量子机器学习(QML)中的动力学在很大程度上仍未得到研究。在这项工作中,我们报告了在SU(4)流形的完全参数化下,双量子比特量子神经网络(QNN)中grokking转变和逐轮双下降的经验观察。我们证明,通过增加电路深度实现的过参数化提高了成功泛化的概率。值得注意的是,这些架构经常在测试误差中表现出逐轮双下降,在关键轮次退化,然后恢复到泛化状态。至关重要的是,我们识别出训练后期的泛化衰减,其中测试误差显著增加,尽管训练损失停滞不前。将此行为与算法稳定性理论联系起来,我们的分析揭示,这种衰减与权重范数的无约束增加相关,从稀疏、相位对齐的谐波解漂移到希尔伯特空间中的过拟合解。我们分析了这种转变的潜在时间动力学,展示了泛化的开始如何与优化超参数(如学习率和权重衰减)相关联。最后,为了减轻后期衰减,我们在损失函数中引入了一个弱的显式权重范数正则化。我们证明,这种结构锚稳定了grokking后阶段,并永久保持了泛化收益,为训练过参数化量子电路提供了一个稳健的框架。

关键词

引用

@article{arxiv.2607.08350,
  title  = {Grokking and epoch-wise double descent in quantum neural networks},
  author = {Daniel Pranjić and Marco Roth and Christian Tutschku},
  journal= {arXiv preprint arXiv:2607.08350},
  year   = {2026}
}