中文

COVID-VIT:基于视觉 transformer 模型从胸部 CT 图像分类 COVID-19

图像与视频处理 2021-07-06 v1 计算机视觉与模式识别

摘要

本文响应 MIA-COV19 挑战赛,旨在基于肺部 CT 图像将 COVID 与非 COVID 进行分类。过去十八个月中,COVID-19 病毒已感染超过 1.82 亿人并导致逾 390 万人死亡,给全球带来重创。总体目标是通过开发可解释的视觉 transformer 深度学习技术,从胸部放射影像中预测 COVID-19 病毒感染诊断,从而实现更快速、准确且透明的人群筛查。本次竞赛共有 5381 个三维(3D)数据集,其中 1552 个用于训练、374 个用于验证、3455 个用于测试。虽然多数数据体为轴位视图,但也有部分受试者的数据为冠状位或矢状位视图,仅有 1 或 2 个切片为轴位视图。因此,在考察基于 3D 数据的分类的同时,本次竞赛仍以 2D 图像为主。本文研究了两种深度学习方法:基于注意力模型的视觉 transformer(ViT)与构建于传统卷积神经网络(CNN)之上的 DenseNet。基于已知真值的验证数据集的初步评估结果表明,ViT 优于 DenseNet,其 F1 分数分别为 0.76 与 0.72。代码已在 GitHub 发布:<https://github/xiaohong1/COVID-ViT>。

关键词

引用

@article{arxiv.2107.01682,
  title  = {COVID-VIT: Classification of COVID-19 from CT chest images based on vision transformer models},
  author = {Xiaohong Gao and Yu Qian and Alice Gao},
  journal= {arXiv preprint arXiv:2107.01682},
  year   = {2021}
}