基于融合机制的多粒度视觉 Fastformer 皮肤瘤分割
计算机视觉与模式识别
2025-04-07 v1 人工智能
摘要
背景:卷积神经网络(CNN)和视觉转换器(ViT)是医学图像分割的主要技术。然而,CNN 仅能获取局部上下文信息,ViT 的二次复杂度导致显著计算成本。同时,使模型能够区分不同严重程度的皮肤瘤边界也是皮肤瘤分割所面临的挑战。目的:本研究旨在优化计算成本与长程依赖建模之间的平衡,并在不同严重程度的皮肤瘤上实现优异的泛化。方法:我们提出一种轻量级 U 形网络,采用带融合机制的视觉 Fastformer(VFFM-UNet)。我们继承了 Fastformer 的加法注意力机制优势,结合元素级乘积和矩阵乘积进行综合特征提取和通道降维,以节省计算成本。为准确识别不同严重程度的皮肤瘤边界,我们设计了融合机制,包括多粒度融合和通道融合,可在粒度和通道级别处理特征图,从而获取不同的上下文信息。结果:在 ISIC2017、ISIC2018 和 PH2 数据集上进行的全面实验表明,VFFM-UNet 在参数数量、计算复杂度和分割性能方面均优于现有最先进模型。简而言之,与 MISSFormer 相比,我们的模型在减少参数和计算成本方面分别降低了 101 倍和 15 倍,同时实现了卓越的分割性能。结论:定性和定量分析表明,VFFM-UNet 通过在参数数量、计算复杂度和分割性能之间取得理想平衡,为现有最先进模型设定了新基准。
引用
@article{arxiv.2504.03108,
title = {Multi-Granularity Vision Fastformer with Fusion Mechanism for Skin Lesion Segmentation},
author = {Xuanyu Liu and Huiyun Yao and Jinggui Gao and Zhongyi Guo and Xue Zhang and Yulin Dong},
journal= {arXiv preprint arXiv:2504.03108},
year = {2025}
}