中文

MG-3D:多粒度知识增强的3D医学视觉语言预训练

计算机视觉与模式识别 2024-12-10 v1 人工智能

摘要

3D医学图像分析在众多临床应用中起着关键作用。然而,标注数据稀缺以及模型的泛化能力受限,阻碍了AI驱动模型的发展。放射科报告易于获取,可作为弱监督信号。然而,大规模视觉语言预训练(VLP)在3D医学图像分析领域仍未得到充分探索。 Specifically,对多粒度放射学语义及其在患者间关联性的 insufficient 调查导致未能充分利用大规模体积报告数据。考虑患者内跨模态语义一致性和患者间语义关联性,我们提出了一种多任务VLP方法MG-3D,在大规模数据(47.1K)上进行预训练,通过以下两个方面应对挑战:1)通过跨模态全局对齐和补充模态引导的局部重建,建立体积语义与每个患者多粒度医学知识之间的对应关系,确保不同模态的患者内特征共同代表相同的语义内容;2)基于患者间细粒度报告关联性,对患者间视觉语义进行关联,通过对比学习保持对全局个体差异的敏感性,增强判别性特征表示。此外,我们探讨了规模定律,以探索潜在的性能提升。对九个单模态和跨模态临床任务进行全面评估,以评估模型效能。 extensive 在内部和外部数据集上的实验表明,MG-3D在迁移性、可扩展性和泛化性方面均表现出色,展示了其在推动3D医学图像分析特征表示方面的潜力。代码将公开:https://github.com/Xuefeng-Ni/MG-3D。

关键词

引用

@article{arxiv.2412.05876,
  title  = {MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training},
  author = {Xuefeng Ni and Linshan Wu and Jiaxin Zhuang and Qiong Wang and Mingxiang Wu and Varut Vardhanabhuti and Lihai Zhang and Hanyu Gao and Hao Chen},
  journal= {arXiv preprint arXiv:2412.05876},
  year   = {2024}
}

备注

10 Pages