中文

基于自适应 Transformer 注意力和多尺度融合的脊椎 3D 分割

计算机视觉与模式识别 2025-03-18 v1 机器学习

摘要

本研究提出一种基于改进版 SwinUNETR 的 3D 语义分割方法,用于脊椎,旨在提高分割精度和鲁棒性。针对脊椎图像的复杂解剖结构,本文引入多尺度融合机制,通过利用不同尺度的信息增强特征提取能力,从而提高模型对目标区域的识别准确率。此外,引入自适应注意力机制,使模型能够动态调整对关键区域的注意力,从而优化边界分割效果。实验结果表明,与 3D CNN、3D U-Net 和 3D U-Net + Transformer 相比,本文的方法在 mIoU、mDice 和 mAcc 指标上均取得显著提升,分割性能更佳。消融实验进一步验证了所提出改进方法的有效性,证明多尺度融合和自适应注意力机制对分割任务有积极影响。通过对推理结果的可视化分析,该模型能够更好地恢复脊椎图像的真实解剖结构。未来研究可进一步优化 Transformer 结构并扩大数据规模,以提高模型的泛化能力。本研究为医学图像分割任务提供了高效解决方案,对智能医学图像分析具有重要意义。

关键词

引用

@article{arxiv.2503.12853,
  title  = {Adaptive Transformer Attention and Multi-Scale Fusion for Spine 3D Segmentation},
  author = {Yanlin Xiang and Qingyuan He and Ting Xu and Ran Hao and Jiacheng Hu and Hanchao Zhang},
  journal= {arXiv preprint arXiv:2503.12853},
  year   = {2025}
}