Scopeformer:用于颅内出血分类的 n-CNN-ViT 混合模型
图像与视频处理
2023-02-01 v1 机器学习
摘要
我们提出一种由卷积神经网络(CNNs)集成组成的特征生成骨干网络,以改进新近涌现的 Vision Transformer(ViT)模型。我们解决了 RSNA 颅内出血分类问题,即从计算机断层扫描(CT)切片中识别各类出血类型。我们表明,通过逐步堆叠使用多个 Xception CNN 提取的若干特征图,我们能为 ViT 模型开发特征丰富的输入。我们的方法使 ViT 模型能够在多个层次上关注相关特征。此外,使用多种范式预训练 n 个 CNN 可得到多样化特征集,并进一步提升所提出的 n-CNN-ViT 的性能。我们以 98.04% 的测试准确率和 0.0708 的加权对数损失值取得了结果。所提架构在用于特征提取的 CNN 数量以及 ViT 的规模上均是模块化且可扩展的。
引用
@article{arxiv.2107.04575,
title = {Scopeformer: n-CNN-ViT Hybrid Model for Intracranial Hemorrhage Classification},
author = {Yassine Barhoumi and Ghulam Rasool},
journal= {arXiv preprint arXiv:2107.04575},
year = {2023}
}