从 $\mathcal{O}(n^{2})$ 到 $\mathcal{O}(n)$ 参数:用于生物医学图像分类的视觉 Transformer 中的量子自注意力
计算机视觉与模式识别
2025-06-26 v2 人工智能
机器学习
摘要
我们证明了量子视觉 Transformer(QViT),即将视觉 Transformer(ViT)中的自注意力(SA)机制替换为量子自注意力(QSA)机制的 ViT,在使用减少 99.99% 参数的同时,能够匹配最先进的生物医学图像分类器。QSA 通过用参数化量子神经网络(QNN)替换线性 SA 层来产生,从而生成 QSA 机制并将参数缩放从 减少到 。在 RetinaMNIST 上,我们的超参数高效 QViT 优于包括 CNN 和 ViT 在内的 14 种 SOTA 方法中的 13 种,实现了 56.5% 的准确率,仅比顶级的 MedMamba 模型低 0.88%,同时使用的参数减少了 99.99%(1K 对 14.5M),GFLOPs 减少了 89%。我们首次研究了生物医学图像分类中从经典视觉 Transformer 到量子视觉 Transformer 的知识蒸馏(KD),表明 QViT 在跨越多种模态的八个不同数据集上保持与经典 ViT 相当的性能,并具有改进的 QSA 参数效率。我们的高量子比特架构从 KD 预训练中获益更多,表明 QSA 参数与 KD 有效性之间存在缩放关系。这些发现确立了 QSA 作为迈向参数高效生物医学图像分析的实用架构选择。
引用
@article{arxiv.2503.07294,
title = {From $\mathcal{O}(n^{2})$ to $\mathcal{O}(n)$ Parameters: Quantum Self-Attention in Vision Transformers for Biomedical Image Classification},
author = {Thomas Boucher and John Whittle and Evangelos B. Mazomenos},
journal= {arXiv preprint arXiv:2503.07294},
year = {2025}
}
备注
Submitted for EMA4MICCAI 2025