基于多尺度Transformer架构的准确医学图像分类
计算机视觉与模式识别
2025-02-11 v1 机器学习
摘要
本研究引入一种基于增强Transformer架构的AI驱动皮肤瘤分类算法,旨在解决医学图像分析中准确性和鲁棒性的挑战。通过整合多尺度特征融合机制并优化自注意力过程,该模型有效提取了全局和局部特征,增强了其检测边界模糊且结构复杂的瘤损的能力。在ISIC 2017数据集上的性能评估表明,改进后的Transformer在准确率、AUC、F1-分数和精确率等关键指标上超越了ResNet50、VGG19、ResNext和Vision Transformer等既定AI模型。Grad-CAM可视化进一步突出了模型的可解释性,展示了算法关注区域与实际瘤损部位之间的强烈一致性。这项研究致力于发展先进AI模型在医学影像中的应用,为更准确可靠的诊断工具铺平了道路。未来工作将探索该方法对更广泛医学影像任务的可扩展性,并考察多模态数据的集成,以提升面向智能医疗保健的AI驱动诊断框架。
引用
@article{arxiv.2502.06243,
title = {Multi-Scale Transformer Architecture for Accurate Medical Image Classification},
author = {Jiacheng Hu and Yanlin Xiang and Yang Lin and Junliang Du and Hanchao Zhang and Houze Liu},
journal= {arXiv preprint arXiv:2502.06243},
year = {2025}
}