MobileUtr:重新审视轻量级 CNN 与 Transformer 的关系以实现高效医学图像分割
图像与视频处理
2023-12-05 v1 计算机视觉与模式识别
摘要
由于医学图像的稀缺性和特定成像特征,将 Vision Transformer(ViT)轻量化以实现高效医学图像分割是一项重大挑战,而当前的研究尚未关注这一问题。本工作重新审视了用于医学图像分割的轻量级通用网络中 CNN 与 Transformer 之间的关系,旨在基础设施设计层面整合两者的优势。为了利用 CNN 固有的归纳偏置,我们抽象出一个类 Transformer 的轻量级 CNN 模块(ConvUtr)作为 ViT 的 patch embeddings,为 Transformer 提供去噪、非冗余且高度浓缩的语义信息。此外,引入了自适应的局部-全局-局部(LGL)模块以促进高效的局部到全局信息流交换,最大化 Transformer 的全局上下文信息提取能力。最后,我们基于 CNN 和 Transformer 构建了一个高效的医学图像分割模型(MobileUtr)。在具有三种不同模态的五个公开医学图像数据集上的大量实验证明了 MobileUtr 优于 SOTA 方法,同时具有更轻的权重和更低的计算成本。代码可在 https://github.com/FengheTan9/MobileUtr 获取。
引用
@article{arxiv.2312.01740,
title = {MobileUtr: Revisiting the relationship between light-weight CNN and Transformer for efficient medical image segmentation},
author = {Fenghe Tang and Bingkun Nian and Jianrui Ding and Quan Quan and Jie Yang and Wei Liu and S. Kevin Zhou},
journal= {arXiv preprint arXiv:2312.01740},
year = {2023}
}
备注
13 pages