L2GNet:面向泛化医学图像分割的解剖结构最优局部到全局表示
计算机视觉与模式识别
2025-02-11 v1
摘要
连续潜在空间(CLS)和离散潜在空间(DLS)模型,如 AttnUNet 和 VQUNet,在医学图像分割中表现出色。相比之下,协同连续与离散潜在空间(CDLS)模型在处理细粒度和粗粒度信息方面显示出潜力。然而,它们在建模长程依赖关系方面存在困难。基于 CLS 或 CDLS 的模型,如 TransUNet 或 SynergyNet,擅长捕捉长程依赖关系。由于它们严重依赖使用自注意力的特征池化或聚合,可能会捕捉到冗余区域之间的依赖关系。这阻碍了对解剖结构内容的理解,给建模类内和类间依赖关系带来挑战,增加了假阴性并损害了泛化能力。为解决这些问题,我们提出了 L2GNet,它通过使用最优传输关联从 DLS 获得的离散码,并在可训练的参考上对齐这些码来学习全局依赖关系。L2GNet 在自注意力模型中无需额外的权重矩阵即可实现判别性的即时表示学习,使其在医学应用中计算高效。在多器官分割和心脏数据集上的大量实验证明了 L2GNet 优于包括 CDLS 方法 SynergyNet 在内的最先进方法,为增强深度学习模型在医学图像分析中的性能提供了一种新颖的方法。
引用
@article{arxiv.2502.05229,
title = {L2GNet: Optimal Local-to-Global Representation of Anatomical Structures for Generalized Medical Image Segmentation},
author = {Vandan Gorade and Sparsh Mittal and Neethi Dasu and Rekha Singhal and KC Santosh and Debesh Jha},
journal= {arXiv preprint arXiv:2502.05229},
year = {2025}
}