LUMEN:用于预后与诊断的纵向多模态放射学模型
计算机视觉与模式识别
2026-02-25 v1 机器学习
摘要
大型视觉语言模型(VLM)已从通用应用演进到临床领域的专业化应用,在放射学等临床场景中展现出决策支持的潜力。一个有前景的应用是通过视觉和自然语言问答(VQA)界面辅助放射科医生分析放射学影像数据,如胸片(CXR)。当可获得纵向影像时,放射科医生会分析时间上的变化,这对于准确诊断和预后至关重要。然而,手动进行纵向分析耗时耗力,促使开发能够提供预后能力的训练框架。我们引入一种新颖的训练框架LUMEN,专为纵向CXR解释优化,利用多图像和多任务指令微调以提升预后和诊断性能。我们在公开的MIMIC-CXR及其关联的Medical-Diff-VQA数据集上进行实验。我们进一步构建了一个新型指令遵循数据集,整合纵向研究,实现诊断VQA任务的预后能力。该方法在诊断VQA任务中显著优于基线模型,更重要的是,在预后能力方面展现出有前景的潜力。这些结果凸显了精心设计的指令调优VLM在实现更准确和临床上有意义的纵向放射学影像解释方面的价值。
引用
@article{arxiv.2602.21142,
title = {LUMEN: Longitudinal Multi-Modal Radiology Model for Prognosis and Diagnosis},
author = {Zhifan Jiang and Dong Yang and Vishwesh Nath and Abhijeet Parida and Nishad P. Kulkarni and Ziyue Xu and Daguang Xu and Syed Muhammad Anwar and Holger R. Roth and Marius George Linguraru},
journal= {arXiv preprint arXiv:2602.21142},
year = {2026}
}
备注
Accepted to IEEE International Symposium on Biomedical Imaging (ISBI) 2026