深入探究掩码自编码器在多标签胸部疾病分类中的应用
计算机视觉与模式识别
2022-10-25 v1
摘要
Vision Transformer (ViT) 因其良好的可扩展性、计算效率以及在许多视觉任务中令人信服的性能,已成为最流行的神经架构之一。然而,由于其对数据的大量需求以及标注医疗数据的缺乏,ViT 在医疗任务上的表现劣于卷积神经网络 (CNN)。在本文中,我们使用掩码自编码器 (MAE) 在 266,340 张胸部 X 光片上预训练 ViT,MAE 从每张图像的一小部分重建缺失像素。为作比较,CNN 也使用先进的自监督方法(如 MoCo v2)在同一 266,340 张 X 光片上进行预训练。结果表明,我们的预训练 ViT 在多标签胸部疾病分类上可与最先进的 CNN (DenseNet-121) 相媲美(有时更优)。这一性能归功于我们从预训练和微调 ViT 的实证研究中提取的强配方。预训练配方表明,与自然图像相比,医疗重建需要小得多的图像比例(10% 对比 25%)以及更温和的随机缩放裁剪范围(0.5~1.0 对比 0.2~1.0)。此外,我们指出在可能的情况下优先进行域内迁移学习。微调配方揭示逐层学习率衰减、RandAug 幅度和 DropPath 率是需要考虑的重要因素。我们希望本研究能指导未来关于 Transformer 在更多样医疗成像任务中应用的研究。
引用
@article{arxiv.2210.12843,
title = {Delving into Masked Autoencoders for Multi-Label Thorax Disease Classification},
author = {Junfei Xiao and Yutong Bai and Alan Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2210.12843},
year = {2022}
}
备注
IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2023)