LaB-RAG:用于放射学报告生成的标签提升检索增强生成
计算机视觉与模式识别
2025-10-08 v2 计算与语言
摘要
在当前的图像描述范式中,深度学习模型被训练以从图像嵌入的潜在特征生成文本。我们挑战了精调大型专用模型以提高模型生成准确性的假设。本文提出了标签提升检索增强生成 (LaB-RAG),这是一种基于小模型的方法,用于图像描述,利用以类别标签形式出现的图像描述符来提升使用预训练大型语言模型 (LLM) 的标准检索增强生成 (RAG)。我们将该方法用于放射学报告生成 (RRG),在 MIMIC-CXR 和 CheXpert Plus 上进行研究。我们认为,简单的分类模型结合零样本嵌入可有效地将 X 光图像转换为文本空间作为放射学特定标签。结合标准 RAG,这些派生文本标签可与通用领域 LLM 一起用于生成放射学报告。在从未专门为该任务训练生成式语言模型或图像嵌入模型的情况下,且从未直接“显示” LLM 一张 X 光图像,我们演示了 LaB-RAG 在自然语言和放射学语言指标上均优于其他检索-based RRG 方法,同时在与其他微调视觉-语言 RRG 模型之间实现了具竞争力的结果。我们进一步进行了大量消融实验,以更好地理解 LaB-RAG 的各个组件。我们的结果表明,该方法与微调方法具有更广泛的兼容性和协同作用,可进一步提升 RRG 性能。
引用
@article{arxiv.2411.16523,
title = {LaB-RAG: Label Boosted Retrieval Augmented Generation for Radiology Report Generation},
author = {Steven Song and Anirudh Subramanyam and Irene Madejski and Robert L. Grossman},
journal= {arXiv preprint arXiv:2411.16523},
year = {2025}
}