中文

LVMed-R2:基于感知与反思的医学报告生成复杂推理

计算与语言 2025-04-07 v1

摘要

大型视觉语言模型(LVM)在自动化医学报告生成方面展现出巨大潜力,有望减轻人工报告编写的负担。当前最先进(SOTA)的研究通过医学数据微调通用LVM,以将放射学图像对齐到相应的医学报告。然而,这些LVM的性能仍受限于两个关键因素:其次,LVM缺乏复杂推理能力,导致生成报告中存在逻辑不一致甚至潜在诊断错误;其次,LVM缺乏反思机制,使其无法发现思考过程中的错误。为此,我们提出LVMed-R2,一种新的微调策略,引入复杂推理和反思机制以增强医学报告生成。据我们了解,这是首个将复杂推理引入医学报告生成(MRG)任务的工作。我们的复杂推理包括医学知识注入和感知增强模块,提高LVM诊断准确性,同时通过感知树限制感知范围。进一步,反思机制迫使模型对输出进行自我验证,以纠正潜在错误。我们使用IU-XRay和MIMIC-CXR数据集对LVM进行微调,采用我们提出的LVMed-R2策略。我们的实验结果在自然语言生成(NLG)指标和临床效能(CE)指标方面表明,采用反思机制微调的LVM能够有效纠正输出并执行复杂推理,显著提升了LVM在MRG任务中的性能。

关键词

引用

@article{arxiv.2504.02885,
  title  = {LVMed-R2: Perception and Reflection-driven Complex Reasoning for Medical Report Generation},
  author = {Hao Wang and Shuchang Ye and Jinghao Lin and Usman Naseem and Jinman Kim},
  journal= {arXiv preprint arXiv:2504.02885},
  year   = {2025}
}

备注

10 pages, 3 figures, 1 table