基于Transformer-Mamba混合架构的弱监督体积医学分割
计算机视觉与模式识别
2025-12-12 v1
摘要
弱监督语义分割为训练体积医学影像分割模型提供了标签高效的解决方案。然而,现有方法往往依赖2D编码器,忽视了数据的内在体积特性。我们提出了TranSamba——一种混合Transformer-Mamba架构,旨在捕获3D上下文以实现弱监督体积医学分割。TranSamba在标准Vision Transformer主干网络中增强了Cross-Plane Mamba模块,利用状态空间模型的线性复杂度,在相邻切片之间实现信息交换。信息交换增强了由Transformer模块在切片内计算的两两自注意力,直接贡献于对象局部分辨的注意力图。TranSamba能够以随输入体积深度线性增长的时间复杂度实现有效的体积建模,并在批处理中保持恒定的内存占用。对三个数据集进行的广泛实验表明,TranSamba建立了新的状态-of-the-art性能,在多样化的模态和病理情况下均稳健地超越了现有方法。我们的源代码和训练好的模型已公开访问:https://github.com/YihengLyu/TranSamba。
引用
@article{arxiv.2512.10353,
title = {Hybrid Transformer-Mamba Architecture for Weakly Supervised Volumetric Medical Segmentation},
author = {Yiheng Lyu and Lian Xu and Mohammed Bennamoun and Farid Boussaid and Coen Arrow and Girish Dwivedi},
journal= {arXiv preprint arXiv:2512.10353},
year = {2025}
}