中文

用于医学图像分割的级联注意力解码多尺度层次视觉Transformer

计算机视觉与模式识别 2023-03-30 v1

摘要

Transformer 在医学图像分割中已展现巨大成功。然而,由于底层的单尺度自注意力(SA)机制,Transformer 可能表现出有限的泛化能力。在本文中,我们通过引入多尺度层次视觉 Transformer(MERIT)骨干网络来解决该问题,其通过在多个尺度上计算 SA 来提升模型的泛化性。我们还融入一个基于注意力的解码器,即级联注意力解码(CASCADE),以进一步精炼由 MERIT 生成的多阶段特征。最后,我们引入一种有效的多阶段特征混合损失聚合(MUTATION)方法,通过隐式集成实现更好的模型训练。我们在两个广泛使用的医学图像分割基准(即 Synapse 多器官、ACDC)上的实验证明了 MERIT 优于 SOTA 方法的性能。我们的 MERIT 架构和 MUTATION 损失聚合可用于下游医学图像与语义分割任务。

关键词

引用

@article{arxiv.2303.16892,
  title  = {Multi-scale Hierarchical Vision Transformer with Cascaded Attention Decoding for Medical Image Segmentation},
  author = {Md Mostafijur Rahman and Radu Marculescu},
  journal= {arXiv preprint arXiv:2303.16892},
  year   = {2023}
}

备注

19 pages, 4 figures, MIDL 2023