中文

CATS v2:面向鲁棒医学分割的混合编码器

图像与视频处理 2024-02-02 v3 计算机视觉与模式识别

摘要

卷积神经网络(CNNs)通过捕获边缘与纹理等高阶(局部)信息,在医学图像分割任务中展现出强劲性能。然而,由于卷积核感受野有限,CNNs 难以充分表征全局信息。近来,Transformer 因能更好地建模长程依赖,在医学图像分割中表现良好。但 Transformer 难以像 CNNs 那样有效地捕获高阶空间特征。优秀的分割模型应从局部与全局特征中学习更好的表示,以兼具精度与语义准确性。在我们先前工作中,我们提出了 CATS,一种增强有 Transformer 编码器的 U 形分割网络。本工作中,我们进一步扩展该模型并提出带有混合编码器的 CATS v2。具体而言,混合编码器由基于 CNN 的编码器路径与带偏移窗口的 Transformer 路径并行组成,从而更好地利用局部与全局信息以产生鲁棒的 3D 医学图像分割。我们在不同分辨率的跳跃连接处融合卷积编码器与 Transformer 的信息以形成最终分割。所提方法在三个公开挑战数据集上评估:Beyond the Cranial Vault (BTCV)、Cross-Modality Domain Adaptation (CrossMoDA) 与 Medical Segmentation Decathlon 的任务 5 (MSD-5),分别用于分割腹部器官、前庭神经鞘瘤(VS)与前列腺。与最先进方法相比,我们的方法在更高 Dice 分数方面展现出更优性能。我们的代码公开于 https://github.com/MedICL-VU/CATS。

关键词

引用

@article{arxiv.2308.06377,
  title  = {CATS v2: Hybrid encoders for robust medical segmentation},
  author = {Hao Li and Han Liu and Dewei Hu and Xing Yao and Jiacheng Wang and Ipek Oguz},
  journal= {arXiv preprint arXiv:2308.06377},
  year   = {2024}
}