膀胱癌分类的深度建模与解释
计算机视觉与模式识别
2026-02-11 v1
摘要
基于视觉转换器(ViT)和卷积神经网络(CNN)的深度模型在自然数据集上已展现出卓越性能。然而,这些模型在医学影像领域可能不尽相同,因其中异常区域仅占图像的很小一部分。此挑战促使本研究探索膀胱癌分类任务的最新深度模型。我们提出以下方法进行评估:1)使用13种模型(包括4个CNN和8个基于转换器的模型)进行标准分类;2)进行校准分析以检验这些模型在膀胱癌分类中是否经过良好校准;3)使用GradCAM++评估这些模型的可解释性以辅助临床诊断。我们在公开的多中心膀胱癌数据集上模拟约300次实验,实验结果表明ConvNext系列在分类膀胱癌图像方面表现出有限的泛化能力(例如约60%的准确率)。此外,ViT显示出比ConvNext和swin transformer系列更好的校准效果。我们还引入测试时数据增强以提高模型的可解释性。最终,没有模型能提供一种百搭式可行的可解释模型。ConvNext系列适用于分布内样本,而ViT及其变体适用于解释分布外样本。
引用
@article{arxiv.2602.09324,
title = {Deep Modeling and Interpretation for Bladder Cancer Classification},
author = {Ahmad Chaddad and Yihang Wu and Xianrui Chen},
journal= {arXiv preprint arXiv:2602.09324},
year = {2026}
}
备注
Accepted in IEEE SMC 2025