中文

解剖感知的文本-视觉融合与双视角提示用于细粒度腰椎分割

计算机视觉与模式识别 2026-04-24 v2

摘要

准确的腰椎分割对于诊断脊柱疾病至关重要。现有方法通常采用粗粒度分割策略,缺乏精确诊断所需的细节。此外,它们依赖纯视觉模型阻碍了解剖语义的捕获,导致类别误分类和分割细节差。为了解决这些限制,我们提出了ATM-Net,一个创新框架,采用解剖感知、文本引导的多模态融合机制进行腰椎子结构(即椎体(VBs)、椎间盘(IDs)和椎管(SC))的细粒度分割。ATM-Net采用解剖感知文本提示生成器(ATPG)自适应地将图像注释转换为不同视角下的解剖感知提示。这些信息通过整体解剖感知语义融合(HASF)模块进一步与图像特征集成,构建全面的解剖上下文。通道级对比解剖感知增强(CCAE)模块通过类级通道多模态对比学习进一步增强类别判别并细化分割。在MRSpineSeg和SPIDER数据集上的大量实验表明,ATM-Net显著优于最先进方法,在类别判别和分割细节方面持续改进。例如,ATM-Net在SPIDER上达到Dice 79.39%和HD95 9.91像素,分别优于竞争方法SpineParseNet 8.31%和4.14像素。

关键词

引用

@article{arxiv.2504.03476,
  title  = {Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation},
  author = {Sheng Lian and Jianlong Cai and Dengfeng Pan and Guang-Yong Chen and Hao Xu and Fan Zhang and Guodong Fan and Shuo Li},
  journal= {arXiv preprint arXiv:2504.03476},
  year   = {2026}
}