中文

M4CXR:探索多模态大语言模型在胸部X光诊断中的多任务潜力

计算机视觉与模式识别 2026-04-21 v1 人工智能 计算与语言

摘要

人工智能的快速发展,尤其是大型语言模型(LLM),对各个领域产生了重大影响,包括医疗保健领域。在胸部X光(CXR)分析中,以前的研究采用 LLM,但存在局限性:要么未充分利用 LLM 的多任务能力,要么缺乏临床准确性。本文提出了 M4CXR,一种用于增强 CXR 诊断的多模态 LLM。该模型在一种将各种任务特定数据集整合为对话格式的视觉指令遵循数据集上进行训练。因此,该模型支持多种任务,包括医学报告生成(MRG)、视觉定位和视觉问答(VQA)。M4CXR 通过采用链式思维提示策略,在 MRG 中实现了临床准确性的领先水平,该策略使模型识别 CXR 图像中的发现情况,然后生成相应的报告。该模型能够适应各种 MRG 场景,具体取决于可用输入的情况,包括单图像、多图像和多研究情境。除了 MRG,M4CXR 在视觉定位方面的性能也与专门模型相当,并且在 VQA 中表现出色。定量和定性评估均显示,M4CXR 在 MRG、视觉定位和 VQA 方面具有很好的多功能性,同时始终保持临床准确性。

关键词

引用

@article{arxiv.2408.16213,
  title  = {M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation},
  author = {Jonggwon Park and Soobum Kim and Byungmu Yoon and Jihun Hyun and Kyoyun Choi},
  journal= {arXiv preprint arXiv:2408.16213},
  year   = {2026}
}