以少胜多:紧凑卷积 Transformer 以有限数据实现鲁棒医学图像分类
计算机视觉与模式识别
2023-07-04 v1 机器学习
摘要
Transformer 是跨领域多种任务(从文本生成到图像描述)的非常强大的工具。然而,Transformer 需要大量训练数据,这在生物医学场景中常常是一个挑战,因为高质量标注数据难以获取或获取成本高昂。本研究探讨了紧凑卷积 Transformer(CCT)在有限数据下用于鲁棒医学图像分类的有效性,解决了传统视觉 Transformer 的一个关键问题——其对大型数据集的需求。CCT 作为 Transformer 与卷积层的混合体,在中等规模数据集上展现出高准确率。我们采用了一个包含八种不同细胞类型的外周血细胞图像基准数据集,每类约由 2000 个低分辨率(28x28x3 像素)样本表示。尽管数据集规模小于通常用于视觉 Transformer 的数据集,我们仍取得了 92.49% 的令人满意的分类准确率以及 0.9935 的微平均 ROC AUC。CCT 学习速度也很快,五个 epoch 后验证准确率即超过 80%。对每类的精确率、召回率、F1 和 ROC 的分析表明,各细胞类型的性能均表现强劲。我们的发现凸显了 CCT 的鲁棒性,表明其作为解决生物医学成像中普遍数据稀缺问题的方案的潜力。我们证实了 CCT 在数据受限领域的适用性,并鼓励开展更多关于 CCT 的研究工作。
引用
@article{arxiv.2307.00213,
title = {More for Less: Compact Convolutional Transformers Enable Robust Medical Image Classification with Limited Data},
author = {Andrew Kean Gao},
journal= {arXiv preprint arXiv:2307.00213},
year = {2023}
}
备注
9 pages, 4 figures, 2 tables