利用集成 CNN-Transformer 捕获医学图像中的局部与全局特征
图像与视频处理
2023-11-06 v1 计算机视觉与模式识别
摘要
本文介绍了一种名为可控集成 Transformer 与 CNN(CETC)的突破性分类模型,用于医学图像分析。CETC 模型结合了卷积神经网络(CNN)和 Transformer 的强大能力,有效捕获医学图像中存在的局部和全局特征。模型架构包含三个主要组件:卷积编码器块(CEB)、转置卷积解码器块(TDB)和 Transformer 分类块(TCB)。CEB 负责在不同尺度上捕获多局部特征,并采用 VGGNet、ResNet 和 MobileNet 的组件作为骨干网络。通过这种组合,CEB 能有效检测和编码局部特征。另一方面,TDB 由子解码器组成,利用集成系数对捕获的特征进行解码和求和,使模型能高效整合多尺度信息。最后,TCB 利用 SwT 骨干和专门设计的预测头捕获全局特征,确保对整幅图像的全面理解。本文提供了实验设置与实现的详细信息,包括迁移学习、数据预处理技术和训练设置的使用。CETC 模型使用两个公开的 COVID-19 数据集进行训练和评估。值得注意的是,该模型在各种评估指标上优于现有的最先进(SOTA)模型。实验结果清晰展示了 CETC 模型的优越性,强调了其在准确高效分析医学图像方面的潜力。
引用
@article{arxiv.2311.01731,
title = {Capturing Local and Global Features in Medical Images by Using Ensemble CNN-Transformer},
author = {Javad Mirzapour Kaleybar and Hooman Saadat and Hooman Khaloo},
journal= {arXiv preprint arXiv:2311.01731},
year = {2023}
}