用于高效胸部 X 光与胃肠图像分类的视觉 Transformer
图像与视频处理
2023-04-25 v1 计算机视觉与模式识别
摘要
医学图像分析因其在早期疾病诊断与治疗等不同临床应用中的效用而成为研究热点。卷积神经网络(CNNs)因能从可用数据集中学习复杂特征,已成为医学图像分析任务的事实标准,使其在众多图像理解任务中超越人类。除 CNNs 外,Transformer 架构在医学图像分析任务中也日益流行。然而,尽管该领域取得进展,仍存在可改进空间。本研究使用不同 CNNs 与基于 Transformer 的方法,配合广泛的数据增强技术,在三个不同模态的医学图像数据集上评估其性能。我们评估并比较了视觉 Transformer 模型与其他最先进(SOTA)预训练 CNN 网络的性能。对于胸部 X 光,我们的视觉 Transformer 模型取得了最高 F1 分数 0.9532、召回率 0.9533、马修斯相关系数(MCC)0.9259 与 ROC-AUC 分数 0.97。类似地,对于 Kvasir 数据集,我们取得 F1 分数 0.9436、召回率 0.9437、MCC 0.9360 与 ROC-AUC 分数 0.97。对于 Kvasir-Capsule(大规模 VCE 数据集),我们的 ViT 模型取得加权 F1 分数 0.7156、召回率 0.7182、MCC 0.3705 与 ROC-AUC 分数 0.57。我们发现基于 Transformer 的模型在分类不同解剖结构、发现与异常方面优于或等效于多种 CNN 模型。我们的模型较基于 CNN 的方法有所提升,并表明其可作为算法开发的新的基准算法。
引用
@article{arxiv.2304.11529,
title = {Vision Transformer for Efficient Chest X-ray and Gastrointestinal Image Classification},
author = {Smriti Regmi and Aliza Subedi and Ulas Bagci and Debesh Jha},
journal= {arXiv preprint arXiv:2304.11529},
year = {2023}
}