中文

MS-Twins:用于医学图像分割的多尺度深度自注意力网络

图像与视频处理 2024-09-17 v5 计算机视觉与模式识别

摘要

尽管 Transformer 在自然语言处理中备受青睐,但直到近年来才有一些研究将其应用于医学成像领域。凭借其长程依赖特性,Transformer 有望帮助非常规卷积神经网络克服其固有的空间归纳偏置。最近提出的基于 Transformer 的分割方法仅将 Transformer 作为辅助模块,帮助将全局上下文编码为卷积表示。如何将自注意力与卷积最优结合尚未得到深入研究。为解决这一问题,本文提出了 MS-Twins(Multi-Scale Twins),这是一个基于自注意力与卷积结合的强大分割模型。MS-Twins 能够通过结合不同尺度和级联特征,更好地捕获语义和细粒度信息。与现有的网络结构相比,MS-Twins 在常用的 Synapse 和 ACDC 两个数据集上,相较于以往基于 Transformer 的方法取得了进展。特别是,MS-Twins 在 Synapse 上的性能比 SwinUNet 高 8%。即使与最佳的全卷积医学图像分割网络 nnUNet 相比,MS-Twins 在 Synapse 和 ACDC 上的性能仍略具优势。

关键词

引用

@article{arxiv.2312.07128,
  title  = {MS-Twins: Multi-Scale Deep Self-Attention Networks for Medical Image Segmentation},
  author = {Jing Xu},
  journal= {arXiv preprint arXiv:2312.07128},
  year   = {2024}
}