中文

TransMed:Transformer推进多模态医学图像分类

计算机视觉与模式识别 2021-03-11 v1

摘要

在过去十年中,卷积神经网络(CNN)在医学图像分析任务(如疾病分类、肿瘤分割和病灶检测)中展现出极具竞争力的性能。CNN在提取图像局部特征方面具有很大优势。然而,由于卷积操作的局部性,它不能很好地处理长程关系。最近,transformers已应用于计算机视觉,并在大规模数据集上取得了显著成功。与自然图像相比,多模态医学图像具有明确且重要的长程依赖,而有效的多模态融合策略可大幅提升深度模型的性能。这促使我们研究基于transformer的结构并将其应用于多模态医学图像。现有的基于transformer的网络架构需要大规模数据集以实现更好性能。然而,医学成像数据集相对较小,这使得纯transformer难以应用于医学图像分析。因此,我们提出用于多模态医学图像分类的TransMed。TransMed结合CNN与transformer的优势,高效提取图像低级特征并建立模态间的长程依赖。我们针对腮腺肿瘤术前诊断这一挑战性问题评估了我们的模型,实验结果显示了我们所提方法的优势。我们认为CNN与transformer的结合在大量医学图像分析任务中具有巨大潜力。据我们所知,这是首个将transformers应用于医学图像分类的工作。

关键词

引用

@article{arxiv.2103.05940,
  title  = {TransMed: Transformers Advance Multi-modal Medical Image Classification},
  author = {Yin Dai and Yifan Gao},
  journal= {arXiv preprint arXiv:2103.05940},
  year   = {2021}
}

备注

8 pages, 4 figures