中文

GLoG-CSUnet:融合可适配影像组学特征以增强视觉 Transformer 的医学图像分割

计算机视觉与模式识别 2025-07-14 v2 人工智能 机器学习

摘要

视觉 Transformer(ViTs)通过捕获长程相关性,在医学图像语义分割(MISS)中展现出良好前景。然而,ViTs 往往难以有效建模局部空间信息,而这对于精确分割细微解剖结构至关重要,尤其是在缺乏大规模预训练的小型数据集上。我们提出了 Gabor 与高斯-拉普拉斯卷积 Swin 网络(GLoG-CSUnet),这是一种通过引入可学习影像组学特征来增强基于 Transformer 的模型的新型架构。该方法集成了动态自适应的 Gabor 滤波器和高斯-拉普拉斯(LoG)滤波器,以捕获纹理、边缘和边界信息,从而增强 Transformer 模型所处理的特征表示。我们的方法独特地融合了 Transformer 的长程依赖建模能力与 Gabor 和 LoG 特征的纹理分析能力。在 Synapse 多器官和 ACDC 心脏分割数据集上的评估表明,GLoG-CSUnet 显著优于现有最优模型,在 Synapse 上 Dice 分数提升 1.14%,在 ACDC 上提升 0.99%,而计算开销极小(分别仅增加 15 和 30 个参数)。GLoG-CSUnet 的灵活设计使其能够与多种基础模型集成,为在 Transformer 架构中引入受影像组学启发的特征提取方法提供了一条有前景的途径。代码实现已在 GitHub 开源:https://github.com/HAAIL/GLoG-CSUnet。

关键词

引用

@article{arxiv.2501.02788,
  title  = {GLoG-CSUnet: Enhancing Vision Transformers with Adaptable Radiomic Features for Medical Image Segmentation},
  author = {Niloufar Eghbali and Hassan Bagher-Ebadian and Tuka Alhanai and Mohammad M. Ghassemi},
  journal= {arXiv preprint arXiv:2501.02788},
  year   = {2025}
}