中文

Masked LoGoNet:面向医疗领域的快速准确 3D 图像分析

计算机视觉与模式识别 2025-04-01 v3 机器学习

摘要

由于数据集构建成本高昂,进而导致可用的标注训练数据有限,标准的现代基于机器学习的成像方法在医疗应用中面临挑战。此外,在部署后,这些方法通常每天用于处理大量数据,给医疗机构带来高昂的维护成本。在本文中,我们引入了一种名为 LoGoNet 的新型神经网络架构,并配有量身定制的自监督学习 (SSL) 方法以缓解这些挑战。LoGoNet 在 U 型架构中集成了新型特征提取器,利用大核注意力 (LKA) 和双重编码策略,熟练地捕获长程和短程特征依赖关系。这与依赖增加网络容量来增强特征提取的现有方法形成对比。鉴于学习复杂且通常不规则的躯体器官形状(如脾脏)的困难,我们模型中这些新颖技术的结合在医学图像分割中尤为有益。作为补充,我们提出了一种专为 3D 图像量身定制的新型 SSL 方法,以弥补大型标注数据集的缺乏。该方法在多任务学习框架中结合了掩码和对比学习技术,并兼容 Vision Transformer (ViT) 和基于 CNN 的模型。我们在两个标准数据集(即 BTCV 和 MSD)的众多任务中展示了我们方法的有效性。与八个 state-of-the-art 模型的基准比较突显了 LoGoNet 在推理时间和准确性方面的卓越性能。

关键词

引用

@article{arxiv.2402.06190,
  title  = {Masked LoGoNet: Fast and Accurate 3D Image Analysis for Medical Domain},
  author = {Amin Karimi Monsefi and Payam Karisani and Mengxi Zhou and Stacey Choi and Nathan Doble and Heng Ji and Srinivasan Parthasarathy and Rajiv Ramnath},
  journal= {arXiv preprint arXiv:2402.06190},
  year   = {2025}
}

备注

Accepted to KDD 2024