中文

基于最优传输的视觉-语言桥接:通过大语言模型实现放射学报告生成

计算机视觉与模式识别 2025-07-08 v1

摘要

放射学报告生成是医学AI中的重要应用,已取得显著成果。同时,大语言模型(LLM)在各个领域展现出惊人的性能。然而,实证研究表明,通用LLM倾向于关注语言流畅性而非临床有效性,缺乏有效捕获X射线图像与其对应文本之间关系,导致临床实用性差。为此,我们提出了基于最优传输的放射学报告生成框架(OTDRG),利用最优传输(OT)将图像特征与报告中提取的疾病标签对齐,以有效桥接跨模态鸿沟。OTDRG的核心组件为对齐与微调,其中OT利用标签特征编码和图像视觉特征编码的结果,以最小化跨模态距离,然后将图像和文本特征整合用于LLM微调。此外,我们设计了一个新型疾病预测模块,用于在验证和测试期间预测X射线图像中包含的疾病标签。在MIMIC-CXR和IU X-Ray数据集上进行评估,OTDRG在自然语言生成(NLG)和临床有效性(CE)指标上均实现了状态的最佳性能,生成的报告不仅语言连贯,而且临床准确。

关键词

引用

@article{arxiv.2507.03908,
  title  = {Bridging Vision and Language: Optimal Transport-Driven Radiology Report Generation via LLMs},
  author = {Haifeng Zhao and Yufei Zhang and Leilei Ma and Shuo Xu and Dengdi Sun},
  journal= {arXiv preprint arXiv:2507.03908},
  year   = {2025}
}