具有域不变多模态掩蔽重建的鲁棒医学视觉-语言模型预训练
机器学习
2026-02-23 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
医学视觉-语言模型在医学图像和临床文本的联合推理方面显示出巨大潜力,但其性能常因成像设备、采集协议和报告风格的差异导致的域偏移而下降。现有的多模态预训练方法大多忽视了鲁棒性,将其视为下游适应问题。在这项工作中,我们提出了鲁棒多模态掩蔽重建,一个将鲁棒性目标显式纳入掩蔽视觉-语言学习的自监督预训练框架。Robust-MMR集成了非对称扰动感知掩蔽、域一致性正则化和模态弹性约束,以鼓励域不变表示。我们在多个医学视觉-语言基准上评估了Robust-MMR,包括医学视觉问答(VQA-RAD、SLAKE、VQA-2019)、跨域图像-文本分类(MELINDA)和鲁棒图像-字幕检索(ROCO)。Robust-MMR在VQA-RAD上达到了78.9%的跨域准确率,比最强基线高出3.8个百分点,并在SLAKE和VQA-2019上分别达到了74.6%和77.0%的准确率。在扰动评估下,Robust-MMR将VQA-RAD准确率从69.1%提升至75.6%。对于图像-文本分类,跨域MELINDA准确率从70.3%提升至75.2%,而检索实验显示在扰动下平均排名退化从超过16降至4.1。定性结果进一步展示了在疾病检测和结构异常评估方面临床推理的改进。这些发现表明,在预训练期间显式建模鲁棒性能够为实际部署产生更可靠和可迁移的医学视觉-语言表示。
引用
@article{arxiv.2602.17689,
title = {Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction},
author = {Melika Filvantorkaman and Mohsen Piri},
journal= {arXiv preprint arXiv:2602.17689},
year = {2026}
}
备注
28 pages, 3 figures