EMCAD:高效多尺度卷积注意力解码器用于医学图像分割
图像与视频处理
2024-05-14 v1 计算机视觉与模式识别
摘要
高效且有效的解码机制在医学图像分割中至关重要,尤其是在计算资源有限的场景下。然而,这些解码机制通常伴随高计算成本。为此,我们引入EMCAD(Efficient Multi-scale Convolutional Attention Decoding),一种新的高效多尺度卷积注意力解码器,旨在优化性能和计算效率。EMCAD利用独特的多尺度深度可分离卷积模块,通过多尺度卷积显著增强特征图。EMCAD还采用通道注意力、空间注意力和分组(大核)门控注意力机制,能够有效捕捉复杂的空间关系,同时聚焦于关键区域。通过采用分组和深度可分离卷积,EMCAD计算高效且扩展性佳(例如,在标准编码器上仅需1.91M参数和0.381G FLOPs)。我们的严格评估覆盖12个数据集,涉及6种医学图像分割任务,结果显示EMCAD在参数数量和FLOPs分别降低79.4%和80.3%,同时实现了最先进(SOTA)性能。此外,EMCAD对不同编码器具有良好的适应性,跨任务分割具有广泛的灵活性,进一步证明了EMCAD作为提升医学图像分析效率与准确性的有前景的工具。我们的实现已公开于https://github.com/SLDGroup/EMCAD。
引用
@article{arxiv.2405.06880,
title = {EMCAD: Efficient Multi-scale Convolutional Attention Decoding for Medical Image Segmentation},
author = {Md Mostafijur Rahman and Mustafa Munir and Radu Marculescu},
journal= {arXiv preprint arXiv:2405.06880},
year = {2024}
}
备注
14 pages, 5 figures, 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)