MIMO:一种医学视觉语言模型,具备视觉指涉多模态输入和像素 grounding 多模态输出
计算机视觉与模式识别
2025-10-14 v1
摘要
目前,医学视觉语言模型在医学视觉问答任务中广泛应用。然而,现有模型面临两个问题:输入方面,模型仅依赖文本指令,缺乏对图像中视觉线索的直接理解;输出方面,模型仅给出文本答案,缺乏与图像关键区域的关联。为此,我们提出了统一的医学视觉语言模型 MIMO,具备视觉指涉多模态输入和像素 grounding 多模态输出。MIMO 不仅可以将视觉线索和文本指令结合起来理解复杂的医学图像和语义,还能将文本输出中的医学术语在图像中进行 grounding。为克服医学领域相关数据稀缺的挑战,我们提出了 MIMOSeg,一个涵盖 895K 样本的全面医学多模态数据集。MIMOSeg 从四个不同角度构建,涵盖基本指令遵循和具有多模态输入和多模态输出的复杂问答。我们在多个下游医学多模态任务上进行了实验。广泛的实验结果验证了 MIMO 能够独特地组合视觉指涉和像素 grounding 能力,这些能力在以前的模型中不可用。
引用
@article{arxiv.2510.10011,
title = {MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output},
author = {Yanyuan Chen and Dexuan Xu and Yu Huang and Songkun Zhan and Hanpin Wang and Dongxue Chen and Xueping Wang and Meikang Qiu and Hang Li},
journal= {arXiv preprint arXiv:2510.10011},
year = {2025}
}
备注
CVPR 2025