中文

Lingshu:通用多模态医疗理解与推理基础模型

计算与语言 2025-06-16 v4 人工智能 计算机视觉与模式识别

摘要

多模态大型语言模型(MLLM)因大规模数据集和先进训练策略,在理解常见视觉元素方面展现出惊人的能力。然而,其在医疗应用中的有效性受限于医疗场景中数据与任务的内在差异与通用领域的差异。具体而言,现有医疗 MLLM 面临以下关键局限性:(1)医学知识覆盖范围有限,超出医学影像部分;(2)数据策展过程次优,导致幻觉现象增多;(3)缺乏针对复杂医疗情景的推理能力。为此,我们首先提出了全面的数据策展程序:(1)高效获取不仅来自医学影像,还来自广泛医学文本和通用领域数据的丰富医学知识数据;(2)合成准确的医学描述、视觉问答(VQA)和推理样本。结果,我们构建了一个充满广泛医学知识的数据集。基于策展数据,我们引入了医学专用 MLLM:Lingshu。Lingshu 经过多阶段训练,以嵌入医学专长并逐步提升任务解决能力。此外,我们初步探索了应用基于可验证奖励的强化学习范式来提升 Lingshu 的医学推理能力。我们还开发了 MedEvalKit,一个统一的评估框架,整合了领先的多模态和文本医学基准,实现标准化、公平且高效的模型评估。我们对 Lingshu 在三个基本医疗任务上的性能进行了评估:多模态问答、文本问答和医学报告生成。结果表明,Lingshu 在大多数任务上均优于现有开源多模态模型。

关键词

引用

@article{arxiv.2506.07044,
  title  = {Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning},
  author = {LASA Team and Weiwen Xu and Hou Pong Chan and Long Li and Mahani Aljunied and Ruifeng Yuan and Jianyu Wang and Chenghao Xiao and Guizhen Chen and Chaoqun Liu and Zhaodonghui Li and Yu Sun and Junao Shen and Chaojun Wang and Jie Tan and Deli Zhao and Tingyang Xu and Hao Zhang and Yu Rong},
  journal= {arXiv preprint arXiv:2506.07044},
  year   = {2025}
}

备注

Technical Report, 53 pages, 25 tables, and 16 figures. Our webpage is https://alibaba-damo-academy.github.io/lingshu/