UniMedVL:通过观察-知识-分析统一医学多模态理解与生成
计算机视觉与模式识别
2025-10-29 v2
摘要
医学诊断应用需要能够处理多模态医学输入(图像、患者史、实验室结果)并生成多样化输出,包括文本报告和视觉内容(标注、分割掩码和图像)。尽管有此需求,但现有的医学 AI 系统却破坏了这一统一过程:医学图像理解模型能够解释图像却无法生成视觉输出,而医学图像生成模型能够合成图像却无法提供文本解释。这导致数据表示、特征集成和任务层多模态能力方面存在差距。为此,我们提出了一个多层次框架,灵感来自诊断工作流程中的 Observation-Knowledge-Analysis(OKA)范式。具体而言,在观察层,我们构建了 UniMed-5M,一个包含超过 560 万样本的数据集,将多样化单模态数据重新格式化为多模态对,以进行基础观察。在知识层,我们提出了渐进式课程学习,以系统性地引入医学多模态知识。在分析层,我们引入 UniMedVL,这是首个能够在单一架构中同时进行图像理解和生成任务的医学统一多模态模型。UniMedVL 在五个医学图像理解基准上取得优异性能,在八种医学影像模态的生成质量上与专用模型持平。关键的是,我们的统一架构实现了双向知识共享:生成任务提升了视觉理解特征,表明在单一医学框架中集成传统上分离的能力可在 diverse medical vision-language 任务中实现改进。代码地址为 https://github.com/uni-medical/UniMedVL。
引用
@article{arxiv.2510.15710,
title = {UniMedVL: Unifying Medical Multimodal Understanding And Generation Through Observation-Knowledge-Analysis},
author = {Junzhi Ning and Wei Li and Cheng Tang and Jiashi Lin and Chenglong Ma and Chaoyang Zhang and Jiyao Liu and Ying Chen and Shujian Gao and Lihao Liu and Yuandong Pu and Huihui Xu and Chenhui Gou and Ziyan Huang and Yi Xin and Qi Qin and Zhongying Deng and Diping Song and Bin Fu and Guang Yang and Yuanfeng Ji and Tianbin Li and Yanzhou Su and Jin Ye and Shixiang Tang and Ming Hu and Junjun He},
journal= {arXiv preprint arXiv:2510.15710},
year = {2025}
}