中文

AgileFormer: 用于医学图像分割的空间敏捷Transformer UNet

计算机视觉与模式识别 2024-09-18 v2 图像与视频处理

摘要

在过去的几十年中,深度神经网络,特别是卷积神经网络,在各种医学图像分割任务中取得了最先进的性能。最近,视觉Transformer(ViT)的引入显著改变了深度分割模型的格局。由于ViT出色的性能和可扩展性,人们对其关注日益增加。然而,我们认为当前基于视觉Transformer的UNet(ViT-UNet)分割模型的设计可能无法有效处理医学图像分割任务中感兴趣目标的异质外观(例如不同的形状和大小)。为了应对这一挑战,我们提出了一种结构化方法,将空间动态组件引入ViT-UNet。这种自适应使模型能够有效捕获具有不同外观的目标特征。这是通过三个主要组件实现的:\textbf{(i)} 可变形patch嵌入;\textbf{(ii)} 空间动态多头注意力;\textbf{(iii)} 可变形位置编码。这些组件被集成到一个新颖的架构中,称为AgileFormer。AgileFormer是一种为医学图像分割设计的空间敏捷ViT-UNet。在三个分割任务上使用公开数据集的实验证明了所提出方法的有效性。代码可在\href{https://github.com/sotiraslab/AgileFormer}{https://github.com/sotiraslab/AgileFormer}获取。

关键词

引用

@article{arxiv.2404.00122,
  title  = {AgileFormer: Spatially Agile Transformer UNet for Medical Image Segmentation},
  author = {Peijie Qiu and Jin Yang and Sayantan Kumar and Soumyendu Sekhar Ghosh and Aristeidis Sotiras},
  journal= {arXiv preprint arXiv:2404.00122},
  year   = {2024}
}