利用低层胸部 X 光特征语料库的 Vision Transformer 用于 COVID-19 诊断与严重程度量化
图像与视频处理
2021-04-16 v1 计算机视觉与模式识别
机器学习
摘要
开发一种利用胸部 X 光(CXR)诊断并量化 COVID-19 严重程度的鲁棒算法,需要大量精心整理的 COVID-19 数据集,这在全球 COVID-19 大流行下难以收集。另一方面,具有其他表现的 CXR 数据十分丰富。这种情况非常适合于 Vision Transformer(ViT)架构,其中大量未标记数据可通过自注意力机制的结构化建模来使用。然而,现有 ViT 的使用并非最优,因为标准 ViT 中通过直接分块展平或 ResNet 主干进行特征嵌入并非针对 CXR 设计。为解决此问题,我们在此提出一种新颖的 Vision Transformer,其利用从提取常见 CXR 表现的主干网络获得的低层 CXR 特征语料库。具体而言,该主干网络首先使用大型公共数据集训练以检测常见异常表现,如实变、不透明、水肿等。然后,来自主干网络的嵌入特征被用作 Transformer 模型的语料库,用于 COVID-19 的诊断和严重程度量化。我们在来自完全不同机构的各种外部测试数据集上评估我们的模型,以评估泛化能力。实验结果证实,我们的模型在诊断和严重程度量化任务中均能取得最先进的性能,并具有优越的泛化能力,这是广泛部署的必要条件。
引用
@article{arxiv.2104.07235,
title = {Vision Transformer using Low-level Chest X-ray Feature Corpus for COVID-19 Diagnosis and Severity Quantification},
author = {Sangjoon Park and Gwanghyun Kim and Yujin Oh and Joon Beom Seo and Sang Min Lee and Jin Hwan Kim and Sungjun Moon and Jae-Kwang Lim and Jong Chul Ye},
journal= {arXiv preprint arXiv:2104.07235},
year = {2021}
}
备注
13 pages