中文

MobileUNETR:一种用于高效医学图像分割的轻量级端到端混合 Vision Transformer

计算机视觉与模式识别 2024-09-06 v1 人工智能

摘要

皮肤癌分割在医学图像分析中提出了重大挑战。许多现有解决方案主要基于 CNN,面临着缺乏全局上下文理解的问题。另外,一些方法采用大规模 Transformer 模型来弥补全局上下文差距,但这是以模型大小和计算复杂度为代价的。最后,许多基于 Transformer 的方法主要依赖基于 CNN 的解码器,忽略了基于 Transformer 的解码模型的优势。认识到这些局限性,我们通过引入 MobileUNETR 来满足对高效轻量级解决方案的需求,该模型旨在克服与 CNN 和 Transformer 相关的性能限制,同时最小化模型大小,向高效的图像分割迈出了有希望的一步。MobileUNETR 具有 3 个主要特征:1)MobileUNETR 包含一个轻量级的混合 CNN-Transformer 编码器,以帮助高效地平衡局部和全局上下文特征提取;2)一种新颖的混合解码器,在解码阶段同时利用不同分辨率的低级和全局特征以进行精确的掩码生成;3)超越大型复杂架构,MobileUNETR 以 300 万参数和 1.3 GFLOP 的计算复杂度实现了卓越的性能,参数和 FLOPS 分别减少了 10 倍和 23 倍。我们在四个公开可用的皮肤病变分割数据集上进行了大量实验,以验证我们提出方法的有效性,包括 ISIC 2016、ISIC 2017、ISIC 2018 和 PH2 数据集。代码将公开于:https://github.com/OSUPCVLab/MobileUNETR.git

关键词

引用

@article{arxiv.2409.03062,
  title  = {MobileUNETR: A Lightweight End-To-End Hybrid Vision Transformer For Efficient Medical Image Segmentation},
  author = {Shehan Perera and Yunus Erzurumlu and Deepak Gulati and Alper Yilmaz},
  journal= {arXiv preprint arXiv:2409.03062},
  year   = {2024}
}

备注

Accepted at ECCV 2024 - BioImage Computing Workshop (Oral)