用于乳腺病灶分类的基于混合注意力机制的高效多尺度掩码自编码器
计算机视觉与模式识别
2026-01-26 v4
摘要
结合 Vision Transformers (ViT) 的自监督学习 (SSL) 在医学图像分析中展现出巨大潜力。然而,标准自注意力的二次复杂度 () 对高分辨率生物医学任务构成了严重障碍,实际上将资源受限的研究实验室排除在使用最先进模型之外。为了在不牺牲诊断准确性的前提下解决这一计算瓶颈,我们提出了 \textbf{MIRAM},一种利用\textbf{混合注意力机制}的多尺度掩码自编码器。我们的架构采用双解码器设计,独特地将语义学习与细节重建解耦:标准 Transformer 解码器在低分辨率下捕获全局语义,而线性复杂度解码器(对比了 Linformer、Performer 和 Nyströmformer)则处理计算成本高昂的高分辨率重建。这将上采样阶段的复杂度从二次降至线性 (),从而能够在消费级 GPU 上进行高保真训练。我们在 CBIS-DDSM 乳腺 X 线摄影数据集上验证了该方法。值得注意的是,我们基于 Nyströmformer 的变体实现了 \textbf{61.0\%} 的分类准确率,优于标准 MAE (58.9\%) 和 MoCo-v3 (60.2\%),且所需内存显著减少。这些结果表明,混合注意力架构能够使高分辨率医疗 AI 民主化,让硬件资源有限的研究人员也能使用强大的 SSL。
引用
@article{arxiv.2503.07157,
title = {Efficient Multi-scale Masked Autoencoders with Hybrid-Attention Mechanism for Breast Lesion Classification},
author = {Hung Q. Vo and Pengyu Yuan and Zheng Yin and Kelvin K. Wong and Chika F. Ezeana and Son T. Ly and Hien V. Nguyen and Stephen T. C. Wong},
journal= {arXiv preprint arXiv:2503.07157},
year = {2026}
}