中文

探究视觉 Transformer 在医学图像分类中对抗标签噪声的鲁棒性

图像与视频处理 2024-02-27 v1 计算机视觉与模式识别 机器学习

摘要

医学图像分类数据集中的标签噪声严重阻碍了监督深度学习方法的训练,削弱了其泛化能力。随着标签噪声率的增加,模型的测试性能往往下降。近年来,已提出多种方法来减轻医学图像分类中标签噪声的影响并增强模型的鲁棒性。这些工作主要采用基于 CNN 的架构作为分类器的骨干网络进行特征提取。然而,近年来,基于 Vision Transformer (ViT) 的骨干网络已取代 CNN,展现出更优的性能和更强的学习泛化特征的能力,尤其是在数据集较大时。尽管如此,此前尚无工作严格调查基于 Transformer 的骨干网络如何处理医学图像分类中标签噪声的影响。本文研究了 ViT 对抗标签噪声的架构鲁棒性,并将其与 CNN 进行了比较。我们使用了两个医学图像分类数据集——COVID-DU-Ex 和 NCT-CRC-HE-100K,并通过注入不同比例的标签噪声对其进行污染。此外,我们表明预训练对于确保 ViT 在监督训练中对抗标签噪声的增强鲁棒性至关重要。

关键词

引用

@article{arxiv.2402.16734,
  title  = {Investigating the Robustness of Vision Transformers against Label Noise in Medical Image Classification},
  author = {Bidur Khanal and Prashant Shrestha and Sanskar Amgain and Bishesh Khanal and Binod Bhattarai and Cristian A. Linte},
  journal= {arXiv preprint arXiv:2402.16734},
  year   = {2024}
}