HistoViT:用于精确可扩展直组织病理癌症诊断的视觉变换器
图像与视频处理
2025-08-18 v1 计算机视觉与模式识别
机器学习
摘要
准确且可扩展的癌症诊断仍是现代病理学中的关键挑战,尤其是对于表现出复杂组织变异性的恶性肿瘤,如乳腺癌、前列腺癌、骨癌和宫颈癌。本研究提出一种基于变换器的深度学习框架,用于直组织病理图像中的多类肿瘤分类。利用微调的视觉变换器(ViT)架构,我们的方法解决了传统卷积神经网络的关键局限性,提供了更好的性能、更少的预处理要求和更好的跨组织类型的可扩展性。为使模型适用于直组织病理癌症图像,我们实施了简练的预处理管道,将切块全切片图像转换为PyTorch张量,并通过数据归一化进行标准化。这确保了与ViT架构的兼容性,并增强了收敛稳定性和整体分类性能。我们在四个基准数据集上对模型进行评估:ICIAR2018(乳腺癌)、SICAPv2(前列腺癌)、UT-Osteosarcoma(骨癌)和SipakMed(宫颈癌)数据集——结果显示在所有数据集上均显著优于现有深度学习方法。我们的方案分别实现了99.32%、96.92%、95.28%和96.94%的乳腺癌、前列腺癌、骨癌和宫颈癌分类准确率,所有数据集的受试者工作曲线下面积(AUC)均超过99%。这些结果确认了基于变换器的架构在数字病理学中的稳健性、可 generalization性和临床潜力。我们的工作代表了可靠、自动化和可解释的癌症诊断系统的重要进步,这些系统有助于减轻诊断负担并改善医疗保健结果。
引用
@article{arxiv.2508.11181,
title = {HistoViT: Vision Transformer for Accurate and Scalable Histopathological Cancer Diagnosis},
author = {Faisal Ahmed},
journal= {arXiv preprint arXiv:2508.11181},
year = {2025}
}
备注
13 pages, 3 Figures