中文

医学图像分类的深度建模与优化

计算机视觉与模式识别 2025-05-30 v1

摘要

深度模型,如卷积神经网络(CNNs)和视觉 Transformer(ViT),在图像分类中展现出卓越的性能。然而,这些深度模型需要大量数据进行微调,由于数据隐私问题,这在医疗领域是不切实际的。此外,尽管对比语言图像预训练(CLIP)在自然领域表现良好,但其在医疗领域的潜力尚未得到充分研究。为了应对这些挑战,我们考虑了三种场景:1)我们引入了一种新颖的 CLIP 变体,使用四个 CNN 和八个 ViT 作为图像编码器,用于脑癌和皮肤癌的分类;2)我们将 12 个深度模型与两种联邦学习技术相结合以保护数据隐私;3)我们引入传统机器学习(ML)方法以提高这些深度模型在未见领域数据上的泛化能力。实验结果表明,在 HAM10000 数据集上,maxvit 在多模态学习中表现出最高的平均(AVG)测试指标(AVG = 87.03%),而在 FL 模型中,convnext\_l 展现出卓越的测试结果,F1 分数为 83.98%,相比之下 swin\_b 为 81.33%。此外,在 ISIC2018 中,使用支持向量机(SVM)可以将 swin transformer 系列的整体测试指标提高约 2% 的 AVG。我们的代码可在 https://github.com/AIPMLab/SkinCancerSimulation 获取。

关键词

引用

@article{arxiv.2505.23040,
  title  = {Deep Modeling and Optimization of Medical Image Classification},
  author = {Yihang Wu and Muhammad Owais and Reem Kateb and Ahmad Chaddad},
  journal= {arXiv preprint arXiv:2505.23040},
  year   = {2025}
}

备注

Accepted in ISBI2025