中文

HiFuse:面向医学图像分类的分层多尺度特征融合网络

图像与视频处理 2022-09-22 v1 计算机视觉与模式识别

摘要

在卷积神经网络(CNN)的推动下,医学图像分类得到了快速发展。由于卷积核感受野大小固定,难以捕获医学图像的全局特征。尽管基于自注意力的 Transformer 能够建模长程依赖,但其计算复杂度高且缺乏局部归纳偏置。大量研究表明,全局与局部特征对图像分类至关重要。然而,医学图像存在大量噪声、分散特征、类内差异和类间相似性。本文提出一种称为 HiFuse 的三分支分层多尺度特征融合网络结构,作为一种用于医学图像分类的新方法。它能在不破坏各自建模的前提下,从多尺度层次融合 Transformer 与 CNN 的优势,从而提高各类医学图像的分类精度。我们设计了一种局部与全局特征块的并行层次结构,以在不同语义尺度上高效提取局部特征与全局表示,并具备在不同尺度上建模的灵活性以及与图像尺寸相关的线性计算复杂度。此外,设计了一种自适应分层特征融合块(HFF block),以综合利用各层次获得的特性。HFF block 包含空间注意力、通道注意力、残差倒置 MLP 和快捷连接,以自适应融合各分支不同尺度特征间的语义信息。我们提出的模型在 ISIC2018 数据集上比基线高 7.6%,在 Covid-19 数据集上高 21.5%,在 Kvasir 数据集上高 10.4%。与其他先进模型相比,HiFuse 模型表现最佳。我们的代码已开源,可从 https://github.com/huoxiangzuo/HiFuse 获取。

关键词

引用

@article{arxiv.2209.10218,
  title  = {HiFuse: Hierarchical Multi-Scale Feature Fusion Network for Medical Image Classification},
  author = {Xiangzuo Huo and Gang Sun and Shengwei Tian and Yan Wang and Long Yu and Jun Long and Wendong Zhang and Aolun Li},
  journal= {arXiv preprint arXiv:2209.10218},
  year   = {2022}
}