中文

在频域中学习多轴表示用于医学图像分割

图像与视频处理 2024-09-25 v2 计算机视觉与模式识别

摘要

最近,视觉Transformer(ViT)由于在空间域中应用自注意力机制来建模全局知识,已被广泛用于医学图像分割(MIS)。然而,许多研究集中在改进空间域中的模型,而忽略了频域信息的重要性。因此,我们提出了基于U形架构的多轴外部权重UNet(MEW-UNet),通过用我们的多轴外部权重块替换ViT中的自注意力。具体地,我们的块对输入特征的三个轴执行傅里叶变换,并在频域中分配由我们的外部权重生成器生成的外部权重。然后,执行逆傅里叶变换将特征变换回空间域。我们在四个数据集上评估了我们的模型,包括Synapse、ACDC、ISIC17和ISIC18数据集,由于有效利用了频域信息,我们的方法展示了有竞争力的性能。

关键词

引用

@article{arxiv.2312.17030,
  title  = {Learning Multi-axis Representation in Frequency Domain for Medical Image Segmentation},
  author = {Jiacheng Ruan and Jingsheng Gao and Mingye Xie and Suncheng Xiang},
  journal= {arXiv preprint arXiv:2312.17030},
  year   = {2024}
}

备注

This paper has been accepted by Machine Learning Journal