中文

评估多模态大语言模型的诊断分类能力:来自骨关节炎计划的启示

计算机视觉与模式识别 2026-01-07 v1 人工智能 图像与视频处理

摘要

多模态大语言模型(MLLM)在医学视觉问答(VQA)和报告生成方面表现出前景,但这些生成和解释能力并不可靠地转化为疾病特定的分类。我们评估了MLLM架构在膝关节炎(OA)胸片分类中的诊断分类能力,而该任务在现有医学MLLM基准测试中仍不充分代表,即使膝关节炎影响约30000万至40000万人。通过系统性消融研究,我们在不同训练策略下操作视觉编码器、连接器和大语言模型(LLM),测量每个组件对诊断准确性的贡献。在我们的分类任务中,仅训练的视觉编码器在分类准确性方面就能超过完整的MLLM管道,微调LLM对基于提示的指导没有实质性的改进。此外,针对小型平衡数据集(500张图像)进行LoRA微调,优于在大规模但类别不平衡数据集(5778张图像)上训练,表明数据平衡和质量对此任务的重要性大于数据规模。这些发现表明,对于特定领域的医学分类,LLM更适合作为解释器和报告生成器,而非主要分类器。因此,MLLM架构似乎不太适用于需要高确定性的医学图像诊断分类任务。我们建议在开发临床可应用系统时,优先优化视觉编码器并谨慎策划数据集。

关键词

引用

@article{arxiv.2601.02443,
  title  = {Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative},
  author = {Li Wang and Xi Chen and XiangWen Deng and HuaHui Yi and ZeKun Jiang and Kang Li and Jian Li},
  journal= {arXiv preprint arXiv:2601.02443},
  year   = {2026}
}