MOSMOS:借助医学报告监督的多器官分割
计算机视觉与模式识别
2024-09-05 v1
摘要
受现代医疗系统中大量多模态数据的影响,例如医学图像和报告,医学视觉语言预训练(Med-VLP)在粗粒度下游任务(即医学分类、检索和视觉问答)方面展现出惊人的成就。然而,将 Med-VLP 学习的知识传递到细粒度的多器官分割任务的问题几乎未被调查。多器官分割主要由于缺乏大规模完全标注数据集以及相同器官在不同疾病个体间形状和大小的差异导致。本文提出一种新的预训练与微调框架,用于 Multi-Organ Segmentation by 利用 Medical repOrt Supervision(MOSMOS)。具体而言,我们首先引入全局对比学习,以最大程度对齐医学图像-报告对。在预训练阶段,为弥补粒度差异,我们进一步利用多标签识别来隐式学习图像像素与器官标签之间的语义对应关系。更重要的是,我们的预训练模型可通过引入像素-标签注意力图 transferred to any segmentation model。我们利用不同的网络设置(即 2D U-Net 和 3D UNETR)来验证其通用性。我们在 BTCV、AMOS、MMWHS 和 BRATS 数据集上使用不同疾病和模态进行了广泛评估。在各种设置下,实验结果均显示我们框架的有效性。该框架可作为促进未来研究在医学报告监督下自动注释任务的基础。
引用
@article{arxiv.2409.02418,
title = {MOSMOS: Multi-organ segmentation facilitated by medical report supervision},
author = {Weiwei Tian and Xinyu Huang and Junlin Hou and Caiyue Ren and Longquan Jiang and Rui-Wei Zhao and Gang Jin and Yuejie Zhang and Daoying Geng},
journal= {arXiv preprint arXiv:2409.02418},
year = {2024}
}
备注
14 pages, 7 figures