皮肤癌检测中的 CNN、Transformer、混合模型与视觉语言模型
计算机视觉与模式识别
2026-05-27 v1
摘要
皮肤癌是全球范围内常见且快速增长的恶性肿瘤。早期检测对于改善预后至关重要。基于皮肤镜和临床图像训练的深度学习模型可支持自动化快速分诊。然而,许多研究仅评估了有限的模型架构,且实验设置在不同研究之间存在差异。本文在PAD-UFES-20数据集上,对十二种深度学习模型进行统一评估,用于二分类皮肤癌检测。这些模型涵盖四类:卷积神经网络(CNN)、视觉转换器(ViT)、混合卷积转换器骨干网络以及视觉语言模型(VLM)。采用AUC、最大F1分数及其精确率和召回率,以及在80%特异度下的灵敏度(反映筛查需求)评估性能。我们的结果表明,经过充分调优的CNN已提供强基线,但基于转换器的模型系列在区分度上持续改进。混合模型(MaxViT Tiny、CoAtNet0)和基于SigLIP的VLM实现了排序性能与临床相关操作点的整体最佳平衡,而基于CLIP的模型实现了高精度。所有实验的完整代码已公开。这些发现为皮肤癌筛查中哪些模型系列最适合实际部署提供了实用指导,并为PAD-UFES-20数据集上后续工作建立了可复现的参考基准。
引用
@article{arxiv.2605.26294,
title = {CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection},
author = {Durjoy Dey and Yuhong Yan and Hassan Hajjdiab},
journal= {arXiv preprint arXiv:2605.26294},
year = {2026}
}
备注
13 pages, 3 figures, accepted at ICPRAI 2026, The Fifth International Conference on Pattern Recognition and Artificial Intelligence. To appear in Lecture Notes in Computer Science