中文

利用低层胸部 X 光特征语料库的 Vision Transformer 用于 COVID-19 诊断与严重程度量化

图像与视频处理 2021-04-16 v1 计算机视觉与模式识别 机器学习

摘要

开发一种利用胸部 X 光(CXR)诊断并量化 COVID-19 严重程度的鲁棒算法,需要大量精心整理的 COVID-19 数据集,这在全球 COVID-19 大流行下难以收集。另一方面,具有其他表现的 CXR 数据十分丰富。这种情况非常适合于 Vision Transformer(ViT)架构,其中大量未标记数据可通过自注意力机制的结构化建模来使用。然而,现有 ViT 的使用并非最优,因为标准 ViT 中通过直接分块展平或 ResNet 主干进行特征嵌入并非针对 CXR 设计。为解决此问题,我们在此提出一种新颖的 Vision Transformer,其利用从提取常见 CXR 表现的主干网络获得的低层 CXR 特征语料库。具体而言,该主干网络首先使用大型公共数据集训练以检测常见异常表现,如实变、不透明、水肿等。然后,来自主干网络的嵌入特征被用作 Transformer 模型的语料库,用于 COVID-19 的诊断和严重程度量化。我们在来自完全不同机构的各种外部测试数据集上评估我们的模型,以评估泛化能力。实验结果证实,我们的模型在诊断和严重程度量化任务中均能取得最先进的性能,并具有优越的泛化能力,这是广泛部署的必要条件。

关键词

引用

@article{arxiv.2104.07235,
  title  = {Vision Transformer using Low-level Chest X-ray Feature Corpus for COVID-19 Diagnosis and Severity Quantification},
  author = {Sangjoon Park and Gwanghyun Kim and Yujin Oh and Joon Beom Seo and Sang Min Lee and Jin Hwan Kim and Sungjun Moon and Jae-Kwang Lim and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2104.07235},
  year   = {2021}
}

备注

13 pages