基于自适应 Transformer 注意力和多尺度融合的脊椎 3D 分割
计算机视觉与模式识别
2025-03-18 v1 机器学习
摘要
本研究提出一种基于改进版 SwinUNETR 的 3D 语义分割方法,用于脊椎,旨在提高分割精度和鲁棒性。针对脊椎图像的复杂解剖结构,本文引入多尺度融合机制,通过利用不同尺度的信息增强特征提取能力,从而提高模型对目标区域的识别准确率。此外,引入自适应注意力机制,使模型能够动态调整对关键区域的注意力,从而优化边界分割效果。实验结果表明,与 3D CNN、3D U-Net 和 3D U-Net + Transformer 相比,本文的方法在 mIoU、mDice 和 mAcc 指标上均取得显著提升,分割性能更佳。消融实验进一步验证了所提出改进方法的有效性,证明多尺度融合和自适应注意力机制对分割任务有积极影响。通过对推理结果的可视化分析,该模型能够更好地恢复脊椎图像的真实解剖结构。未来研究可进一步优化 Transformer 结构并扩大数据规模,以提高模型的泛化能力。本研究为医学图像分割任务提供了高效解决方案,对智能医学图像分析具有重要意义。
引用
@article{arxiv.2503.12853,
title = {Adaptive Transformer Attention and Multi-Scale Fusion for Spine 3D Segmentation},
author = {Yanlin Xiang and Qingyuan He and Ting Xu and Ran Hao and Jiacheng Hu and Hanchao Zhang},
journal= {arXiv preprint arXiv:2503.12853},
year = {2025}
}