TCSAFormer:一种用于医学图像分割的高效视觉Transformer,具令牌压缩与稀疏注意力
计算机视觉与模式识别
2025-08-07 v1
摘要
近年来,基于 Transformer 的方法因其捕获长程依赖的卓越能力在医学图像分割中取得了显著进展。然而,这些方法通常面临两个主要局限:其计算复杂度随输入序列长度呈二次方增长;此外,vanilla Transformer 中的前馈网络(FFN)模块通常依赖全连接层,限制了模型捕获局部上下文信息和多尺度特征的能力,这对于精确语义分割至关重要。为此,我们提出一种高效医学图像分割网络,命名为 TCSAFormer。该网络包含两个关键思想:其一,引入压缩注意力(Compressed Attention, CA)模块,结合令牌压缩与像素级稀疏注意力,动态聚焦于每个查询的最相关键值对。通过全局剪枝无关令牌并合并冗余令牌,显著降低计算复杂度,同时提升模型捕获 token 间关系的能力。其二,引入双分支前馈网络(Dual-Branch Feed-Forward Network, DBFFN)模块,以取代标准 FFN,捕获局部上下文特征和多尺度信息,从而增强模型的特征表示能力。我们在三个公开医学图像分割数据集上进行大量实验:ISIC-2018、CVC-ClinicDB 和 Synapse。实验结果表明,TCSAFormer 在性能上优于现有 SOTA 方法,同时保持更低的计算开销,实现了效率与准确性的最佳权衡。
引用
@article{arxiv.2508.04058,
title = {TCSAFormer: Efficient Vision Transformer with Token Compression and Sparse Attention for Medical Image Segmentation},
author = {Zunhui Xia and Hongxing Li and Libin Lan},
journal= {arXiv preprint arXiv:2508.04058},
year = {2025}
}
备注
11 pages, 7 figures, 4 tables; The code is available at https://github.com/XiaZunhui/TCSAFormer