中文

基于多模态数据的深度学习与变换模型在乳腺癌分类中的性能评估

图像与视频处理 2024-10-15 v1 计算机视觉与模式识别

摘要

乳腺癌(BC)的发生率和死亡率居高不下,为全球女性构成重大关切。深度学习(DL)在乳腺癌分类方面已优于人类专家读者。然而,当前主要使用单模态(数字乳腺导视)特征,可能限制了诊断模型的当前性能。为此,我们收集了一个新型的多模态数据集,包含影像和文本数据。本研究提出一种用于乳腺癌分类的多模态 DL 架构,利用图像(乳腺导视;四个视图)和文本数据(放射学报告)来自我们新建的内部数据集。对影像和文本数据应用了各种数据增强技术,以提升训练数据规模。我们探索了十一种 SOTA DL 架构(VGG16、VGG19、ResNet34、ResNet50、MobileNet-v3、EffNet-b0、EffNet-b1、EffNet-b2、EffNet-b3、EffNet-b7 和 Vision Transformer(ViT))作为影像特征提取器。对于文本特征提取,我们利用人工神经网络(ANN)或长短期记忆网络(LSTM)。随后,将合并的影像和文本特征输入到 ANN 分类器中进行乳腺癌分类,采用后期融合技术。我们评估了不同的特征提取器和分类器组合。实验表明,VGG19+ANN 组合实现了最高的 0.951 准确率。对于精确度,VGG19+ANN 组合再度超越其他基于 CNN 和 LSTM、ANN 的架构,达到 0.95 的分数。最高的灵敏度 0.903 由 VGG16+LSTM 实现。最高的 F1 分数 0.931 由 VGG19+LSTM 实现。只有 VGG16+LSTM 达到了最佳的 0.937 的受试者工作曲线下面积(AUC),VGG16+LSTM 紧随其后,AUC 为 0.929。

关键词

引用

@article{arxiv.2410.10146,
  title  = {Performance Evaluation of Deep Learning and Transformer Models Using Multimodal Data for Breast Cancer Classification},
  author = {Sadam Hussain and Mansoor Ali and Usman Naseem and Beatriz Alejandra Bosques Palomo and Mario Alexis Monsivais Molina and Jorge Alberto Garza Abdala and Daly Betzabeth Avendano Avalos and Servando Cardona-Huerta and T. Aaron Gulliver and Jose Gerardo Tamez Pena},
  journal= {arXiv preprint arXiv:2410.10146},
  year   = {2024}
}

备注

The paper was accepted and presented in 3rd Workshop on Cancer Prevention, detection, and intervenTion (CaPTion @ MICCAI 2024)