中文

结合 KAN 的 Transformer 与膨胀邻域注意力的医学图像分类

计算机视觉与模式识别 2025-11-04 v3

摘要

卷积网络、transformer、混合模型以及基于 Mamba 的架构在各类医学图像分类任务中展现出优异性能。然而,这些方法主要针对利用标注数据对干净图像进行分类而设计。相比之下,现实临床数据常包含多中心研究特有的图像损坏,且这些损坏源于不同制造商成像设备的差异。本文提出医学视觉 Transformer(MedViTV2),首次将 Kolmogorov-Arnold Network(KAN)层引入 transformer 架构,旨在实现泛化的医学图像分类。我们开发了高效的 KAN 模块,在降低计算负荷的同时提升原 MedViT 的精度。此外,为克服 MedViTV2 在扩大规模时的脆弱性,我们提出增强的膨胀邻域注意力(DiNA),这是对高效融合点积注意力核的改进,能捕获全局上下文并扩展感受野,从而有效扩展模型并解决特征坍缩问题。同时,引入分层混合策略,以高效方式堆叠局部特征感知与全局特征感知模块,平衡局部与全局特征感知以提升性能。在 17 个医学图像分类数据集和 12 个损坏医学图像数据集上的大量实验表明,MedViTV2 在 29 项实验中的 27 项取得 SOTA 结果,且降低了计算复杂度。MedViTV2 的计算效率较前代提升 44\%,并显著提高精度,在 MedMNIST 上提升 4.6\%,在 NonMNIST 上提升 5.8\%,在 MedMNIST-C 基准上提升 13.4\%。

关键词

引用

@article{arxiv.2502.13693,
  title  = {Medical Image Classification with KAN-Integrated Transformers and Dilated Neighborhood Attention},
  author = {Omid Nejati Manzari and Hojat Asgariandehkordi and Taha Koleilat and Yiming Xiao and Hassan Rivaz},
  journal= {arXiv preprint arXiv:2502.13693},
  year   = {2025}
}