中文

CX-Mind:基于课程引导强化学习的胸腔X光多模态大语言模型

机器学习 2025-08-07 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

胸腔X光(CXR)影像是临床实践中最广泛使用的诊断模态之一,涵盖广泛的诊断任务。近期进展显示,推理式多模态大语言模型(MLLM)在医学影像中的大规模应用旨在提升诊断效率和可解释性。然而,现有多模态模型主要依赖“一次性”诊断方法,缺乏对推理过程的可验证监督,导致在多任务CXR诊断中出现推理过程冗长、奖励稀疏和频繁幻觉等挑战。为此,我们提出了CX-Mind,这是第一个实现CXR任务交叉式“思考-回答”推理的生成模型,由基于课程的强化学习和可验证过程奖励(CuRL-VPR)驱动。具体而言,我们构建了包含708,473张图像和2,619,148个样本的指令调优数据集CX-Set,并生成了42,828个由临床报告监督的高质量交叉式推理数据。优化在Group Relative Policy Optimization框架下进行两个阶段:首先通过封闭域任务稳定基本推理,然后迁移到开放域诊断,纳入基于规则的条件过程奖励,以规避预训练奖励模型的需求。大量实验结果表明,CX-Mind在视觉理解、文本生成和时空对齐方面显著优于现有医学和通用领域MLLMs,平均性能提升25.1%。在真实世界临床数据集(Rui-CXR)上,CX-Mind实现了14种疾病的平均召回率@1显著优于第二名结果,并通过多中心专家评估进一步确认了其在多个维度上的临床实用性。

关键词

引用

@article{arxiv.2508.03733,
  title  = {CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning},
  author = {Wenjie Li and Yujie Zhang and Haoran Sun and Yueqi Li and Fanrui Zhang and Mengzhe Xu and Victoria Borja Clausich and Sade Mellin and Renhao Yang and Chenrun Wang and Jethro Zih-Shuo Wang and Shiyi Yao and Gen Li and Yidong Xu and Hanyu Wang and Yilin Huang and Angela Lin Wang and Chen Shi and Yin Zhang and Jianan Guo and Luqi Yang and Renxuan Li and Yang Xu and Jiawei Liu and Yao Zhang and Lei Liu and Carlos Gutiérrez SanRomán and Lei Wang},
  journal= {arXiv preprint arXiv:2508.03733},
  year   = {2025}
}