中文

用于胸片多标签疾病分类的数据高效视觉Transformer

计算机视觉与模式识别 2022-08-18 v1

摘要

X 线片是一种通用的诊断工具,用于病理的检测与评估、治疗规划或临床介入中的导航与定位。然而,放射科医师对其的解读与评估可能繁琐且易出错。因此,已提出多种深度学习方法以辅助医师解读 X 线片。这些方法大多依赖卷积神经网络(CNN)从图像中提取特征。尤其在胸片(Chest X-Rays, CXR)病理的多标签分类上,CNN 已被证明十分适用。相反,尽管 Vision Transformers(ViTs)在通用图像上分类性能高且具可解释的局部显著图(可为临床介入增添价值),却尚未应用于该任务。ViTs 不依赖卷积而依赖基于块的自注意力,且与 CNN 不同,其不具备局部连接的先验知识。虽然这带来了更高的容量,ViTs 通常需要过量训练数据,这在医学领域是一大障碍,因为收集大型医学数据集成本高昂。本工作中,我们系统比较了不同数据集规模下 ViTs 与 CNNs 的分类性能,并评估了更具数据效率的 ViT 变体(DeiT)。结果表明:ViTs 与 CNNs 性能相当且 ViTs 略有优势,而若有合理大规模数据集可供训练,DeiTs 优于前者。

关键词

引用

@article{arxiv.2208.08166,
  title  = {Data-Efficient Vision Transformers for Multi-Label Disease Classification on Chest Radiographs},
  author = {Finn Behrendt and Debayan Bhattacharya and Julia Krüger and Roland Opfer and Alexander Schlaefer},
  journal= {arXiv preprint arXiv:2208.08166},
  year   = {2022}
}

备注

Accepted at CURAC22 Conference