中文

基于深度Swin视觉Transformer的转移学习架构用于多类型癌组织学图像分类

图像与视频处理 2026-04-13 v1 计算机视觉与模式识别

摘要

本研究提出了一种基于深度Swin视觉Transformer的转移学习架构,用于Robust多癌组织学图像分类。该框架将分层Swin Transformer与基于ResNet50的卷积特征提取相结合,使模型能够在组织学图像中捕获长程情境依赖性和细粒度局部形态图案。为验证所提架构的效率,本文在包括乳腺癌、口腔癌、肺癌和结直肠癌、肾癌和急性淋巴细胞白血病(ALL)等多个癌种的综合性多癌数据集上执行了广泛实验,分析了包括原始图像和分割后图像在内的不同图像,用于评估模型在异构临床成像条件下的鲁棒性。我们的方案与DenseNet121、DenseNet201、InceptionV3、ResNet50、EfficientNetB3、多个ViT变体以及Swin Transformer模型等多种最新CNN和转移模型进行了基准测试。然而,所有模型都使用统一的管道进行训练和验证,包括平衡的数据预处理、转移学习和微调策略。实验结果表明,所提架构始终实现了优异的性能,在肺结直肠癌、分割后白血病数据集上达到100%的测试准确率,对乳腺癌分类达到最高99.23%的准确率。该模型还实现了近乎完美的精确度、F1分数和召回率,表明在各种癌种类型下都具有高度稳定的得分。总体而言,所提模型建立了一个高度准确、可解释且也鲁棒的多癌分类系统,为未来的研究提供了强大的基准,并提供了一种统一的比较评估,对于设计可靠的AI辅助组织学诊断和临床决策具有重要意义。

关键词

引用

@article{arxiv.2604.09468,
  title  = {DSVTLA: Deep Swin Vision Transformer-Based Transfer Learning Architecture for Multi-Type Cancer Histopathological Cancer Image Classification},
  author = {Muazzem Hussain Khan and Tasdid Hasnain and Md. Jamil khan and Ruhul Amin and Md. Shamim Reza and Md. Al Mehedi Hasan and Md Ashad Alam},
  journal= {arXiv preprint arXiv:2604.09468},
  year   = {2026}
}

备注

25 [ages. 9 Figures