基于CNN的局部视觉Transformer用于COVID-19诊断
图像与视频处理
2022-07-06 v1 计算机视觉与模式识别
摘要
深度学习技术可用作辅助技术,帮助医生快速准确地识别COVID-19感染。近来,Vision Transformer(ViT)凭借其全局感受野在图像分类中展现出巨大潜力。然而,由于缺少CNN固有的归纳偏置,基于ViT的结构导致特征丰富度有限且模型训练困难。本文中,我们提出一种称为Transformer for COVID-19(COVT)的新结构,以提升基于ViT的架构在小型COVID-19数据集上的性能。它使用CNN作为特征提取器以有效提取局部结构信息,并向ViT的多层感知机(MLP)模块引入平均池化以获取全局信息。实验在两个COVID-19数据集和ImageNet数据集上展示了我们方法的有效性。
引用
@article{arxiv.2207.02027,
title = {CNN-based Local Vision Transformer for COVID-19 Diagnosis},
author = {Hongyan Xu and Xiu Su and Dadong Wang},
journal= {arXiv preprint arXiv:2207.02027},
year = {2022}
}
备注
5 pages, 4 figures