中文

改进的 EATFormer:用于医学图像分类的 Vision Transformer

计算机视觉与模式识别 2024-03-21 v1

摘要

医学图像的准确分析对于诊断和预测医疗状况至关重要。依赖放射科医生和临床医生的传统方法存在不一致性和漏诊问题。计算机辅助诊断系统有助于实现早期、准确和高效的诊断。本文提出了一种改进的基于进化算法的 Transformer 架构,用于使用 Vision Transformer 进行医学图像分类。所提出的 EATFormer 架构结合了卷积神经网络和 Vision Transformer 的优势,利用它们识别数据模式并适应特定特征的能力。该架构包含新颖的组件,包括带有前馈网络、全局与局部交互以及多尺度区域聚合模块的增强型 EA-based Transformer 块。它还引入了 Modulated Deformable MSA 模块,用于不规则位置的动态建模。本文讨论了 Vision Transformer (ViT) 模型的关键特性,如分块处理、位置上下文融合和 Multi-Head Attention 机制。引入了多尺度区域聚合模块,该模块聚合来自不同感受野的信息以提供归纳偏置。全局与局部交互模块通过引入用于提取判别性局部信息的局部路径,增强了基于 MSA 的全局模块。在 Chest X-ray 和 Kvasir 数据集上的实验结果表明,与基线模型相比,所提出的 EATFormer 显著提高了预测速度和准确率。

关键词

引用

@article{arxiv.2403.13167,
  title  = {Improved EATFormer: A Vision Transformer for Medical Image Classification},
  author = {Yulong Shisu and Susano Mingwin and Yongshuai Wanwag and Zengqiang Chenso and Sunshin Huing},
  journal= {arXiv preprint arXiv:2403.13167},
  year   = {2024}
}