中文

S3TU-Net:用于肺结节分割的结构化卷积与超像素 Transformer

图像与视频处理 2024-11-20 v1 计算机视觉与模式识别 机器学习

摘要

计算机断层扫描(CT)图像中肺腺癌结节的不规则性和挑战性特征使分期诊断复杂化,使得准确分割对于临床医生提取详细病灶信息至关重要。在本研究中,我们提出了一种分割模型 S3TU-Net,它集成了多维空间连接器和基于超像素的视觉 Transformer。S3TU-Net 建立在多视图 CNN-Transformer 混合架构之上,结合了超像素算法、结构化加权和空间移位技术以实现卓越的分割性能。该模型利用结构化卷积块提取多尺度局部特征,同时减轻过拟合。为了增强多尺度特征融合,我们引入了 S2-MLP Link,在跳跃连接处集成了空间移位和注意力机制。此外,基于残差的超像素视觉 Transformer(RM-SViT)通过采用稀疏相关性学习和多分支注意力来捕获长程依赖关系,从而有效地融合全局和局部特征,残差连接则增强了稳定性和计算效率。在 LIDC-IDRI 数据集上的实验结果表明,S3TU-Net 的 DSC、精确率和 IoU 分别达到了 89.04%、90.73% 和 90.70%。与近期方法相比,S3TU-Net 的 DSC 提高了 4.52%,敏感性提高了 3.16%,其他指标也显示出约 2% 的提升。除了对比和消融研究外,我们还在 EPDB 私有数据集上验证了模型的泛化能力,其 DSC 达到了 86.40%。

关键词

引用

@article{arxiv.2411.12547,
  title  = {S3TU-Net: Structured Convolution and Superpixel Transformer for Lung Nodule Segmentation},
  author = {Yuke Wu and Xiang Liu and Yunyu Shi and Xinyi Chen and Zhenglei Wang and YuQing Xu and Shuo Hong Wang},
  journal= {arXiv preprint arXiv:2411.12547},
  year   = {2024}
}