中文

Scopeformer:用于颅内出血分类的 n-CNN-ViT 混合模型

图像与视频处理 2023-02-01 v1 机器学习

摘要

我们提出一种由卷积神经网络(CNNs)集成组成的特征生成骨干网络,以改进新近涌现的 Vision Transformer(ViT)模型。我们解决了 RSNA 颅内出血分类问题,即从计算机断层扫描(CT)切片中识别各类出血类型。我们表明,通过逐步堆叠使用多个 Xception CNN 提取的若干特征图,我们能为 ViT 模型开发特征丰富的输入。我们的方法使 ViT 模型能够在多个层次上关注相关特征。此外,使用多种范式预训练 n 个 CNN 可得到多样化特征集,并进一步提升所提出的 n-CNN-ViT 的性能。我们以 98.04% 的测试准确率和 0.0708 的加权对数损失值取得了结果。所提架构在用于特征提取的 CNN 数量以及 ViT 的规模上均是模块化且可扩展的。

关键词

引用

@article{arxiv.2107.04575,
  title  = {Scopeformer: n-CNN-ViT Hybrid Model for Intracranial Hemorrhage Classification},
  author = {Yassine Barhoumi and Ghulam Rasool},
  journal= {arXiv preprint arXiv:2107.04575},
  year   = {2023}
}