利用轻量级 Transformer 结合情境协同增强实现高效 3D 医学图像分割
计算机视觉与模式识别
2026-03-25 v1 图像与视频处理
摘要
Transformer 在 3D 医学图像分割中展现出卓越的性能,但其高计算需求以及对大量标注数据的依赖限制了实际应用。为此,我们从模型效率和数据效率两个关键维度入手。具体而言,我们提出了 Light-UNETR—a 一种实现模型效率的轻量级 transformer。Light-UNETR 包含 Lightweight Dimension Reductive Attention (LIDR) 模块,该模块通过多分支注意力机制在降低空间和通道维度的同时捕获全局与局部特征。此外,我们引入了紧凑门控线性单元 (Compact Gated Linear Unit, CGLU),用于以最小参数控制通道间的交互。进一步,我们提出了情境协同增强 (Contextual Synergic Enhancement, CSE) 学习策略,旨在提升 Transformer 的数据效率。该策略首先利用注意力引导替换 (Attention-Guided Replacement) 方式,借助外部情境信息辅助学习未标注数据;随后应用空间掩码一致性 (Spatial Masking Consistency),利用内在情境信息增强未标注数据的位置上下文推理。广泛的基准实验表明,我们方法在性能和效率方面均表现优异。例如,在 Left Atrial 分割数据集仅使用 10% 标注数据时,我们的方法相比 BCP 仅凭 1.43% 的 Jaccard 增幅,同时将 FLOPs 降低 90.8%,参数降低 85.8%。代码已发布于 https://github.com/CUHK-AIM-Group/Light-UNETR。
引用
@article{arxiv.2603.23390,
title = {Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation},
author = {Xinyu Liu and Zhen Chen and Wuyang Li and Chenxin Li and Yixuan Yuan},
journal= {arXiv preprint arXiv:2603.23390},
year = {2026}
}
备注
Accepted to IEEE TPAMI