中文

基于自监督表示学习的多特征视觉Transformer用于改进COVID-19诊断

图像与视频处理 2022-08-04 v1 计算机视觉与模式识别 机器学习

摘要

胸部 X 光(CXR)成像由于比 CT 更具成本效益、更广泛可用且采集时间更快,其在 COVID-19 大流行期间的作用发生了演变。为提高 CXR 成像的诊断性能,越来越多的研究探讨了有监督深度学习方法是否能提供额外支持。然而,有监督方法依赖于大量标注的放射影像,这是一项耗时且复杂、需要临床专家参与的过程。由于 COVID-19 患者数据相对稀缺且标注过程成本高昂,自监督学习方法已获得关注,并被提出以达到与全监督学习方法相当的结果。在本工作中,我们研究了自监督学习在从 CXR 图像诊断 COVID-19 疾病背景下的有效性。我们提出了一种多特征 Vision Transformer (ViT) 引导的架构,其中部署交叉注意力机制以从原始 CXR 图像和相应的增强局部相位 CXR 图像中学习信息。我们证明了通过利用基于局部相位的增强 CXR 图像,可以进一步提升基线自监督学习模型的性能。通过使用 10% 标注的 CXR 扫描,所提模型在总计 35,483 张健康(8,851)、普通肺炎(6,045)和 COVID-19(18,159)扫描的 CXR 图像上取得了 91.10% 和 96.21% 的总体准确率,并显示出相对于最先进技术的显著改进。代码见 https://github.com/endiqq/Multi-Feature-ViT

关键词

引用

@article{arxiv.2208.01843,
  title  = {Multi-Feature Vision Transformer via Self-Supervised Representation Learning for Improvement of COVID-19 Diagnosis},
  author = {Xiao Qi and David J. Foran and John L. Nosher and Ilker Hacihaliloglu},
  journal= {arXiv preprint arXiv:2208.01843},
  year   = {2022}
}

备注

Accepted to the 2022 MICCAI Workshop on Medical Image Learning with Limited and Noisy Data