中文

RA-RRG:基于关键短语提取的多模态检索增强放射术报告生成

计算机视觉与模式识别 2026-04-21 v2 计算与语言 机器学习

摘要

自动化放射术报告生成 (RRG) 有望减少放射科医生的工作负担,近期多模态大型语言模型 (MLLM) 的进展使得多模态胸腔 X 光 (CXR) 报告生成成为可能。然而,现有的 MLLM 计算昂贵、需要大规模训练数据,并且可能产生幻觉内容,限制了其实际部署。为解决这些限制,我们提出 RA-RRG,一种检索增强的 RRG 框架,将多模态检索与大型语言模型 (LLM) 结合,以生成放射术报告,同时减少幻觉和计算需求。RA-RRG 使用 LLM 从放射术报告中提取临床必需的关键短语,并检索给定输入图像的相关短语。通过对 LLM 进行检索短语条件化,RA-RRG 有效抑制了幻觉,同时保持了强大的报告生成性能。在 MIMIC-CXR 和 IU X-ray 数据集上进行的实验表明,RA-RRG 在 CheXbert 指标上实现了最先进的成绩,并在与 MLLM 相比下实现了具竞争力的 RadGraph F1 分数。此外,RA-RRG 自然地推广到多视角 RRG,通过聚合来自多个图像的检索短语,凸显了其对实际临床场景的广泛适用性。代码可在 https://github.com/deepnoid-ai/RA-RRG 查阅。

关键词

引用

@article{arxiv.2504.07415,
  title  = {RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction},
  author = {Jonggwon Park and Byungmu Yoon and Soobum Kim and Kyoyun Choi},
  journal= {arXiv preprint arXiv:2504.07415},
  year   = {2026}
}

备注

ACL 2026, Findings of the Association for Computational Linguistics