利用 2D 多模态大语言模型辅助的提升 3D 医学图像理解
计算机视觉与模式识别
2025-09-12 v1
摘要
理解 3D 医学图像体积在医疗领域至关重要,但现有的 3D 医学卷积和变换器基于自监督学习方法往往缺乏深层语义理解。近期发展的多模态大语言模型 (MLLM) 为通过文本描述增强图像理解提供了可行路径。为利用这些 2D MLLM 提高 3D 医学图像理解,我们提出了 Med3DInsight,一种新型预训练框架,将 3D 图像编码器与 2D MLLM 通过专为设计的平面切片感知变换器模块集成。此外,我们的模型采用部分最优传输基于对齐方法,能够更好地容忍来自 LLM 生成内容可能引入的噪声。Med3DInsight 引入了一种无需人工标注即可进行可扩展多模态 3D 医学表征学习的新范式。广泛实验表明,我们在两个下游任务(即分割和分类)中实现了最先进的性能,这些任务覆盖 various 公开数据集,包含 CT 和 MRI 模式,超越当前 SSL 方法。Med3DInsight 可无缝集成到现有的 3D 医学图像理解网络中, potentially 提升其性能。我们的源代码、生成的数据集和预训练模型将在 https://github.com/Qybc/Med3DInsight 上提供。
引用
@article{arxiv.2509.09064,
title = {Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models},
author = {Qiuhui Chen and Xuancheng Yao and Huping Ye and Yi Hong},
journal= {arXiv preprint arXiv:2509.09064},
year = {2025}
}
备注
Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI)