为何文本占优:视觉可能削弱多模态医学决策
计算机视觉与模式识别
2025-12-17 v1 人工智能
摘要
随着大语言模型(LLM)的快速发展,先进的多模态大语言模型(MLLM)在视觉-语言任务上展示了令人印象深刻的零样本能力。然而,在生物医学领域,即使最先进的 MLLM 在基本的医学决策(MDM)任务上也存在困难。我们使用两个具有挑战性的数据集研究了这一局限性:(1)三阶段阿尔茨海默病(AD)分类(正常、轻度认知障碍、痴呆),其中类别差异在视觉上微妙;(2)MIMIC-CXR 胸部 X 光分类,包含 14 个非互斥条件。我们的实证研究表明,仅文本推理始终优于仅视觉或视觉-文本设置,多模态输入往往比仅文本表现更差。为缓解这一问题,我们探索了三种策略:(1)使用带理由标注的示例进行上下文学习,(2)视觉描述生成后接仅文本推理,(3)对视觉编码器进行少样本微调以获得分类监督。这些发现揭示了当前 MLLM 缺乏扎实的视觉理解能力,并为改善医疗领域的多模态决策指明了有前景的方向。
引用
@article{arxiv.2512.13747,
title = {Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making},
author = {Siyuan Dai and Lunxiao Li and Kun Zhao and Eardi Lila and Paul K. Crane and Heng Huang and Dongkuan Xu and Haoteng Tang and Liang Zhan},
journal= {arXiv preprint arXiv:2512.13747},
year = {2025}
}
备注
Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining