LLM-RG4:跨多样输入上下文的灵活且基于事实的放射学报告生成
计算与语言
2024-12-17 v1 计算机视觉与模式识别
摘要
起草放射学报告是一项需要灵活性的复杂任务,放射科医生会根据可用信息和特定临床需求调整内容。然而,当前大多数放射学报告生成 (RRG) 模型被限制在固定的任务范式中,例如从单张图像预测完整的“发现”部分,这固有地导致了输入与输出之间的不匹配。训练好的模型缺乏对多样输入的灵活性,并且可能生成有害的、与输入无关的幻觉。为了弥合当前 RRG 模型与实践中临床需求之间的差距,我们首先开发了一个数据生成流水线,以创建一个新的 MIMIC-RG4 数据集,该数据集考虑了四种常见的放射学报告起草场景,并具有完美对应的输入和输出。其次,我们提出了一种新颖的基于大型语言模型 (LLM) 的 RRG 框架,即 LLM-RG4,它利用了 LLM 灵活的指令遵循能力和广泛的通用知识。我们进一步开发了一个自适应 token 融合模块,该模块提供了处理具有不同输入组合的多样场景的灵活性,同时最大限度地减少了因输入量增加而带来的额外计算负担。此外,我们提出了一种 token 级损失加权策略,以将模型的注意力引导至阳性和不确定的描述上。实验结果表明,LLM-RG4 在 MIMIC-RG4 和 MIMIC-CXR 数据集上的临床效率和自然语言生成方面均达到了最先进的性能。我们定量地证明了我们的模型具有极少的与输入无关的幻觉,而当前的开源模型普遍存在这一问题。
引用
@article{arxiv.2412.12001,
title = {LLM-RG4: Flexible and Factual Radiology Report Generation across Diverse Input Contexts},
author = {Zhuhao Wang and Yihua Sun and Zihan Li and Xuan Yang and Fang Chen and Hongen Liao},
journal= {arXiv preprint arXiv:2412.12001},
year = {2024}
}