中文

STA-Unet:重新思考医学影像分割中的语义冗余

图像与视频处理 2024-10-16 v1 人工智能 计算机视觉与模式识别

摘要

近年来,基于卷积神经网络(CNN)的医学图像分析领域取得了显著进展。尤其是基于 U 型结构(UNet)并采用跳跃连接的深度神经网络已被用于多种医学影像任务,包括器官分割。尽管取得了巨大成功,但 CNN 在学习全局或语义特征方面不够理想,尤其是需要类人推理以理解上下文的特征。许多 UNet 架构尝试通过引入基于 Transformer 的自注意力机制来进行调整,并取得了显著的性能提升。然而,Transformer 本质上在浅层学习时存在冗余,这常常导致注意力计算从相邻像素处增加,提供的信息有限。最近引入的超级标记注意力(STA)机制将超像素从像素空间适应到标记空间,使用超级标记作为紧凑的视觉表示。该方法通过在视觉 Transformer 中学习高效的全局表示来解决浅层的冗余问题。本文在 UNet 架构中引入 STA 模块(STA-UNet),以不损失丰富信息的同时限制冗余。实验结果表明,在四个公开数据集上,STA-UNet 在器官分割任务中以 Dice 系数和 IOU 等指标超越了现有 SOTA 架构。代码已公开。

关键词

引用

@article{arxiv.2410.11578,
  title  = {STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation},
  author = {Vamsi Krishna Vasa and Wenhui Zhu and Xiwen Chen and Peijie Qiu and Xuanzhao Dong and Yalin Wang},
  journal= {arXiv preprint arXiv:2410.11578},
  year   = {2024}
}