LLM-RadJudge: 实现放射科医师级别的 X 光报告生成评估
计算与语言
2024-04-02 v1 人工智能
摘要
评估生成的放射学报告对于放射学 AI 的发展至关重要,但现有指标无法反映该任务的临床需求。本研究提出了一种使用大语言模型(LLM)比较放射学报告以进行评估的新型评估框架。我们比较了各种 LLM 的性能,并证明当使用 GPT-4 时,我们提出的指标实现了接近放射科医师的评估一致性。此外,为了降低成本并提高可访问性以使该方法实用化,我们利用 LLM 评估结果构建了一个数据集,并进行知识蒸馏以训练一个较小的模型。蒸馏后的模型实现了与 GPT-4 相当的评估能力。我们的框架和蒸馏模型为放射学报告生成提供了一种易于访问且高效的评估方法,促进了更具临床相关性的模型的发展。该模型将进一步开源并提供访问。
引用
@article{arxiv.2404.00998,
title = {LLM-RadJudge: Achieving Radiologist-Level Evaluation for X-Ray Report Generation},
author = {Zilong Wang and Xufang Luo and Xinyang Jiang and Dongsheng Li and Lili Qiu},
journal= {arXiv preprint arXiv:2404.00998},
year = {2024}
}
备注
11 pages, 6 figures