从复合图到复合理解:基于生物医学文献开发的多模态大语言模型
计算机视觉与模式识别
2025-12-01 v1 人工智能
计算与语言
摘要
多模态大语言模型(MLLM)在推进医疗保健方面显示出前景,但大多数现有模型局限于单图像理解,大大限制了其在临床工作流程中的适用性。实际情况下,医疗诊断和病程往往需要综合来自不同模态或不同时间点的多个图像的信息。能够实现此类多图像理解的医学 MLLM 的开发受限于缺乏大规模高质量标注训练数据。为解决这一局限性,我们提出一种新型框架,利用生物医学文献中的许可允许的复合图像作为多图像分析的丰富且未得到充分利用的数据源。具体而言,我们设计了一种基于分而治之策略的五阶段、情境感知的指令生成范式。通过将多图像分析分解为可管理的子任务,这种范式使 MLLM 能够超越单面板分析,提供复合理解,学习这些复合图中所蕴含的复杂空间、时间和跨模态关系。通过解析超过 237,000 个复合图及其情境文本,我们开发了 M3LLM,这是一个医学多图像多模态大语言模型。用于基准测试,我们构建了 PMC-MI-Bench,用于复合理解,由医学专家手动验证。大量实验表明,M3LLM 在多图像、单图像、文本-only 和多选题等场景中均显著优于通用型和专业医学 MLLM。值得注意的是,M3LLM 在使用 MIMIC 数据集进行纵向胸片 X 光分析时表现出强大的泛化能力。这项工作建立了一种可扩展且高效的范式,用于开发具备复合推理能力的医学 MLLM,弥合了生物医学文献与实际临床应用之间的鸿沟。
引用
@article{arxiv.2511.22232,
title = {From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation},
author = {Zhen Chen and Yihang Fu and Gabriel Madera and Mauro Giuffre and Serina Applebaum and Hyunjae Kim and Hua Xu and Qingyu Chen},
journal= {arXiv preprint arXiv:2511.22232},
year = {2025}
}