RefineFormer3D:基于自适应多尺度Transformer的高效3D医学图像分割
图像与视频处理
2026-02-19 v1 计算机视觉与模式识别
机器学习
摘要
准确且计算高效的3D医学图像分割仍是临床工作流程中的关键挑战。Transformer-based架构通常在全局上下文建模方面表现优越,但往往以参数数量和内存需求为代价,限制了其临床部署。我们提出RefineFormer3D,一种轻量级分层Transformer架构,在体积医学成像中平衡分割精度与计算效率。该架构集成三个关键组件:(i)基于GhostConv3D的patch嵌入实现高效特征提取并最小化冗余;(ii)采用低秩投影和深度卷积的MixFFN3D模块实现参数高效特征提取;(iii)基于跨注意力融合解码器实现自适应多尺度skip连接集成。RefineFormer3D仅包含2.94M参数,远低于当代Transformer-based方法。在ACDC和BraTS基准上的大量实验表明,RefineFormer3D分别实现了93.44%和85.9%的平均Dice得分,超越或匹配最先进方法,同时所需参数显著更少。此外,模型在GPU上实现快速推理(每体积8.35毫秒),内存需求低,支持在资源受限的临床环境中部署。这些结果将RefineFormer3D确立为临床3D医学图像分割的有效且可扩展解决方案。
引用
@article{arxiv.2602.16320,
title = {RefineFormer3D: Efficient 3D Medical Image Segmentation via Adaptive Multi-Scale Transformer with Cross Attention Fusion},
author = {Kavyansh Tyagi and Vishwas Rathi and Puneet Goyal},
journal= {arXiv preprint arXiv:2602.16320},
year = {2026}
}
备注
13 pages, 5 figures, 7 tables