适配 2D 多模态大语言模型用于 3D CT 图像分析
计算机视觉与模式识别
2026-04-14 v1 人工智能
摘要
3D 医学图像分析在疾病诊断和治疗中具有重要重要性。最近,多模态大语言模型 (MLLM) 显示出稳健的感知能力、强大的跨模态对齐以及有前景的通用性。因此,它们有潜力提高医学报告生成 (MRG) 和医学视觉问答 (MVQA) 的性能,这两者是临床场景中的重要任务。然而,由于 3D 医学图像稀缺,现有的 3D 医学 MLLM 受限于视觉编码器预训练不足且无法提取不同任务所需的定制化图像特征。本文提出首先将一个在 2D 自然图像上进行良好预训练的 2D MLLM 迁移到支持 3D 医学体积输入,同时复用其所有预训练参数。为使视觉编码器能够为各种任务提取定制化图像特征,我们设计了基于文本引导的层次化混合专家 (TGH-MoE) 框架,该框架可在文本提示的指导下区分不同任务。此外,我们提出了两阶段训练策略,以学习任务共享和任务特定的图像特征。实证结果表明,我们的方法在 MRG 和 MVQA 任务上均优于现有的 3D 医学 MLLM。本文的代码将在论文接受后发布。
引用
@article{arxiv.2604.10233,
title = {Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis},
author = {Yang Yu and Dunyuan Xu and Yaoqian Li and Xiaomeng Li and Jinpeng Li and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2604.10233},
year = {2026}
}