中文

Med3DInsight:利用 2D 多模态大语言模型增强 3D 医学图像理解

计算机视觉与模式识别 2024-03-11 v1

摘要

理解 3D 医学图像体积是医学领域的一项关键任务。然而,现有的基于 3D 卷积和 Transformer 的方法对图像体积的语义理解有限,且需要大量体积数据进行训练。多模态大语言模型(MLLMs)的最新进展为借助文本描述理解图像提供了一种新的且有前景的途径。然而,大多数当前的 MLLMs 是为 2D 自然图像设计的。为了利用 2D MLLMs 增强 3D 医学图像理解,我们提出了一种名为 Med3DInsight 的新型预训练框架,该框架将现有的 3D 图像编码器与 2D MLLMs 相结合,并通过设计的平面切片感知 Transformer(PSAT)模块将它们桥接起来。大量实验表明,我们在两个下游分割和分类任务上取得了 SOTA 性能,包括涉及 CT 和 MRI 模态的三个公共数据集,并与十多个基线进行了比较。Med3DInsight 可以轻松集成到任何当前的 3D 医学图像理解网络中,并显著提高其性能。

关键词

引用

@article{arxiv.2403.05141,
  title  = {Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models},
  author = {Qiuhui Chen and Huping Ye and Yi Hong},
  journal= {arXiv preprint arXiv:2403.05141},
  year   = {2024}
}