Med-2E3:二维增强的三维医学多模态大语言模型
计算机视觉与模式识别
2025-10-22 v2
摘要
三维医学图像分析对现代医疗至关重要,但由于在多样化临床场景中泛化能力有限,传统的特定任务模型显得不足。多模态大语言模型为应对这些挑战提供了有前景的解决方案。然而,现有的MLLM在充分利用三维医学图像中蕴含的丰富层次信息方面存在局限。受临床实践启发,放射科医生会同时关注三维空间结构和二维平面内容,我们提出了Med-2E3,一种集成了双三维-二维编码器架构的三维医学MLLM。为了有效地聚合二维特征,我们设计了文本引导的切片间评分模块,该模块根据切片内容和任务指令对每个二维切片的注意力进行评分。据我们所知,Med-2E3是首个将三维和二维特征相结合用于三维医学图像分析的MLLM。在大规模开源三维医学多模态数据集上的实验表明,TG-IS展现出特定任务的注意力分布,并显著优于当前最先进模型。代码可在:https://github.com/MSIIP/Med-2E3 获取。
引用
@article{arxiv.2411.12783,
title = {Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model},
author = {Yiming Shi and Xun Zhu and Kaiwen Wang and Ying Hu and Chenyi Guo and Miao Li and Ji Wu},
journal= {arXiv preprint arXiv:2411.12783},
year = {2025}
}