中文

M3D:利用多模态大语言模型推进 3D 医学图像分析

计算机视觉与模式识别 2024-04-02 v1

摘要

医学图像分析对于临床诊断和治疗至关重要,且越来越多地得到多模态大语言模型的支持。然而,尽管 3D 图像具有更丰富的空间信息,以往的研究主要集中在 2D 医学图像上,3D 图像仍未得到充分探索。本文旨在利用 MLLM 推进 3D 医学图像分析。为此,我们提出了一个大规模 3D 多模态医学数据集 M3D-Data,包含 120K 图像-文本对和 662K 指令-响应对,专为各种 3D 医学任务定制,如图像-文本检索、报告生成、视觉问答、定位和分割。此外,我们提出了 M3D-LaMed,一个用于 3D 医学图像分析的通用多模态大语言模型。进一步地,我们引入了一个新的 3D 多模态医学基准 M3D-Bench,它促进了跨八项任务的自动评估。通过全面评估,我们的方法被证明是用于 3D 医学图像分析的稳健模型,优于现有解决方案。所有代码、数据和模型均公开于:https://github.com/BAAI-DCAI/M3D。

关键词

引用

@article{arxiv.2404.00578,
  title  = {M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models},
  author = {Fan Bai and Yuxin Du and Tiejun Huang and Max Q. -H. Meng and Bo Zhao},
  journal= {arXiv preprint arXiv:2404.00578},
  year   = {2024}
}

备注

MLLM, 3D medical image analysis