中文

基于多孔道融合的 Transformer-卷积网络 (MFTC-Net) 用于 3D 医学图像分割与可视化

图像与视频处理 2024-06-26 v1 计算机视觉与模式识别

摘要

Vision Transformer 在众多视觉应用中展现出优于传统基于卷积的框架的优越性能,包括但不限于 3D 医学图像的分割。为进一步推动这一领域,本研究引入了多孔道融合的 Transformer-卷积网络(MFTC-Net),其将 Swin Transformer 的输出与相应的卷积块输出通过 3D 融合块进行整合。多孔道机制将每个图像块在其原始分辨率上与其金字塔表示相结合,以更好地保留细微细节。该提出的架构在 Synapse 多器官数据集上实现了 Dice 为 89.73、HD95 为 7.31 的分数,显著优于已有结果。 improved 性能还伴随着约 4000 万参数的复杂度降低。我们的代码已公开于 https://github.com/Siyavashshabani/MFTC-Net

关键词

引用

@article{arxiv.2406.17080,
  title  = {Multi-Aperture Fusion of Transformer-Convolutional Network (MFTC-Net) for 3D Medical Image Segmentation and Visualization},
  author = {Siyavash Shabani and Muhammad Sohaib and Sahar A. Mohammed and Bahram Parvin},
  journal= {arXiv preprint arXiv:2406.17080},
  year   = {2024}
}