中文

量子双随机矩阵 Transformer

机器学习 2025-11-11 v2 人工智能 计算工程、金融与科学 计算机视觉与模式识别

摘要

Transformer 的核心在于,softmax 将注意力矩阵归一化为右随机矩阵。先前的研究表明,这往往会 destabilize 训练,而通过 Sinkhorn 算法强制注意力矩阵为双随机矩阵 (DSM) 一致地提高了不同任务、领域和 Transformer 变体的性能。然而,Sinkhorn 算法是迭代的、近似的、非参数的,因此对获得的双随机矩阵不灵活。最近,已证明 DSM 可通过参数化量子电路获得,yielding 一种 novel 量子双随机矩阵的归纳偏置,尚无已知的 classical 类比。以此为动机,我们展示了一种混合 classical-量子双随机矩阵 Transformer (QDSFormer) 的可行性,该模型将 self-attention 层中的 softmax 替换为变分量子电路。我们研究了该电路的表达力,发现它产生更加多样的 DSM,这些 DSM 比 classical operator 更好地保留了信息。在多个小规模对象识别任务中,我们发现 QDSFormer 在性能上一致优于标准 ViT 和其他双随机矩阵 Transformer。除了 Sinkformer 之外,这些比较包括一种 novel 基于 QR 分解的量子灵感双随机矩阵 Transformer,该方法可能独立地具有兴趣。我们的 QDSFormer 还表现出 improved 训练稳定性和较低的性能波动,这表明它可能缓解了 ViT 在小规模数据上的著名不稳定训练。

关键词

引用

@article{arxiv.2504.16275,
  title  = {Quantum Doubly Stochastic Transformers},
  author = {Jannis Born and Filip Skogh and Kahn Rhrissorrakrai and Filippo Utro and Nico Wagner and Aleksandros Sobczyk},
  journal= {arXiv preprint arXiv:2504.16275},
  year   = {2025}
}

备注

NeurIPS 2025 (Spotlight)