中文

基于心脏MRI的多模态大语言模型中图像-文本不确定性传播分析

计算机视觉与模式识别 2025-07-18 v1

摘要

多模态大语言模型(MLLM)能够处理和整合来自多模态来源(如文本和图像)的信息。然而,在大规模MLLM语境中,输入各模态之间的相互关系、由于单个单模态数据而产生的不确定性以及此类不确定性分解后可能的临床应用尚未完全理解。本文提出了一种基于不确定性传播的多模态不确定性传播模型(MUPM),以表征来自图像-only、文本-only以及联合图像-文本变动产生的不确定性之间的关系。使用由心脏MRI扫描和数字健康记录组成的真实临床数据,我们表明MUPM可以用少量样本进行稳健的优化。随后,我们展示了拟合得到的MUPM能够跨越不同的输入数据分布,甚至跨越不同的下游任务实现可迁移。这一可迁移性或许可以解释为共享的预训练、相对轻量的MLLM微调,以及MUPM的低维特性所致。更重要的是,这种所学到的可迁移性量化了这些不确定性之间的关系,使得能够直接应用于临床,其中不确定性可被估计,从而对各种数据或甚至新的一组心脏疾病预测任务进行稳健分析。此外,我们在实验中展示了估计整体不确定性所需的多模态数据量,以及其识别冗余因素的能力,这两种能力被视为具有实际且临床有用的应用。代码已公开于https://github.com/yucheng722/MUPM。

关键词

引用

@article{arxiv.2507.12945,
  title  = {Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardiac MR-Based Applications},
  author = {Yucheng Tang and Yunguan Fu and Weixi Yi and Yipei Wang and Daniel C. Alexander and Rhodri Davies and Yipeng Hu},
  journal= {arXiv preprint arXiv:2507.12945},
  year   = {2025}
}

备注

It is accepted by 28th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI) 2025