面向MRI多器官异常检测的3D模态感知预训练方法
计算机视觉与模式识别
2026-03-04 v2 人工智能
摘要
视觉语言模型(VLM)在医学影像的复杂诊断任务中展现出强大的潜力。然而,将VLM应用于多器官医学影像引入了两个主要挑战:(1)模态特定的视觉语言对齐,(2)跨模态特征融合。本文提出了MedMAP(Medical Modality-Aware Pretraining),一种增强3D MRI中视觉语言表征学习的医学模态感知预训练框架。MedMAP包含模态感知的视觉语言对齐阶段和针对多器官异常检测的微调阶段。在预训练阶段,模态感知编码器隐式捕获联合模态分布,从而改善视觉和文本表征之间的对齐。随后我们在保持文本编码器冻结的情况下,对预训练的视觉编码器进行微调,以适应下游任务。为此,我们构建了MedMoM-MRI3D数据集,包含7,392组3D MRI体积-报告对,涵盖12种MRI模态和9种异常情况,旨在满足各种3D医学分析任务。在MedMoM-MRI3D上的大量实验表明,MedMAP在3D MRI基于的多器官异常检测任务中显著优于现有的VLM方法。我们的代码已公开:https://github.com/RomantiDr/MedMAP。
引用
@article{arxiv.2602.23652,
title = {3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection},
author = {Haowen Zhu and Ning Yin and Xiaogen Zhou},
journal= {arXiv preprint arXiv:2602.23652},
year = {2026}
}