感知与校准:医学多模态大语言模型鲁棒性的分析与增强
计算机视觉与模式识别
2025-12-29 v1
摘要
医学多模态大语言模型在临床应用中展现出了良好的前景。然而,它们对真实世界输入扰动(如成像伪影和文本错误)的敏感性严重削弱了其临床适用性。对这类噪声影响医学 MLLMs 的系统性分析在很大程度上仍未被探索。此外,尽管已有若干工作研究了 MLLMs 在通用领域的鲁棒性,但它们主要关注文本模态并依赖代价高昂的微调,不足以应对复杂的噪声模式并满足医学领域严格的安全标准。为弥补这一差距,本工作系统地分析了各种扰动对医学 MLLMs 在视觉和文本双模态上的影响。基于我们的发现,我们引入了一个无需训练的内在增强多模态校准框架,该框架遵循“感知与校准”原则,利用 MLLMs 固有的去噪能力来增强跨模态鲁棒性。对于视觉模态,我们提出了扰动感知去噪校准,利用 MLLMs 自身的视觉编码器识别噪声模式并执行原型引导的特征校准。对于文本去噪,我们设计了自实例化多智能体系统,利用 MLLMs 的自我评估能力,通过智能体的协作层级来优化含噪文本。我们在 2 个数据集上构建了一个包含跨图像和文本模态 11 种噪声的基准。实验结果表明,我们的方法在多个模态上实现了 SOTA 性能,展现出增强 MLLMs 在真实临床场景中鲁棒性的潜力。
引用
@article{arxiv.2512.21964,
title = {Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models},
author = {Dunyuan XU and Xikai Yang and Yaoqian Li and Juzheng Miao and Jinpeng Li and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2512.21964},
year = {2025}
}