中文

LLaVA-RadZ:多模态大语言模型能否有效应对零样本放射学识别?

计算机视觉与模式识别 2025-09-26 v2

摘要

最近,多模态大语言模型(Multimodal Large Language Models, MLLMs)在各种视觉-语言任务中展现出了卓越的视觉理解和推理能力。然而,我们发现 MLLMs 在传统的视觉问答(Visual Question Answering, VQA)流程中无法有效处理细粒度的医学图像数据,因为它们未能充分利用所提取的特征和可用的医学知识,导致 MLLMs 在零样本医学疾病识别中通常表现不佳。幸运的是,这一局限性并不意味着 MLLMs 从根本上无法解决细粒度识别任务。从特征表示的角度来看,MLLMs 在应对此类具有挑战性的问题上展现出了相当大的潜力。因此,为了应对这一挑战,我们提出了 LLaVA-RadZ,一个简单而有效的零样本医学疾病识别框架,通过利用现有的 MLLM 特征来实现。具体而言,我们设计了一种端到端的训练策略,称为解码端特征对齐训练(Decoding-Side Feature Alignment Training, DFAT),以利用 MLLM 解码器架构的特性,并结合为不同模态定制的模态特定标记。此外,我们引入了领域知识锚定模块(Domain Knowledge Anchoring Module, DKAM)以利用大模型的内在医学知识,从而缓解图像-文本对齐中的类别语义鸿沟。大量实验表明,我们的 LLaVA-RadZ 在零样本疾病识别中显著优于传统 MLLMs,取得了与成熟且高度优化的基于 CLIP 的方法相当的性能。

关键词

引用

@article{arxiv.2503.07487,
  title  = {LLaVA-RadZ: Can Multimodal Large Language Models Effectively Tackle Zero-shot Radiology Recognition?},
  author = {Bangyan Li and Wenxuan Huang and Zhenkun Gao and Yeqiang Wang and Yunhang Shen and Jingzhong Lin and Ling You and Yuxiang Shen and Shaohui Lin and Wanli Ouyang and Yuling Sun},
  journal= {arXiv preprint arXiv:2503.07487},
  year   = {2025}
}