基于 LLM 与 NER 的放射学报告语义相似度研究
计算与语言
2025-10-07 v2
摘要
放射学报告评估是放射科医师培训的关键组成部分,在确保诊断准确性方面发挥着重要作用。作为标准报告工作流程的一部分,初级放射科医师通常准备初步报告,随后由高级放射科医师审查并编辑以生成最终报告。识别初步报告与最终报告之间的语义差异对初级医生至关重要,这既是一种培训工具,也有助于发现临床知识上的不足。尽管放射学领域的人工智能是一个快速发展的领域,但由于需要专业的领域知识,大语言模型(LLM)的应用仍面临挑战。在本文中,我们探讨了 LLM 在放射学领域提供可解释且准确的报告比较方面的能力。我们首先比较了多个 LLM 在比较放射学报告时的表现。随后,我们评估了一种基于命名实体识别(NER)的传统方法。然而,这两种方法在提供关于语义相似度的准确反馈方面均存在局限性。为了解决这一问题,我们提出了 Llama-EntScore,这是一种结合 Llama 3.1 和 NER 的语义相似度评分方法,具有可调权重以强调或弱化特定类型的差异。我们的方法生成用于跟踪进度的定量相似度评分,并对评分给出解释,旨在为审查和完善报告提供有价值的指导。我们发现,与放射科医师提供的真实评分相比,我们的方法实现了 67% 的精确匹配准确率,在 +/- 1 范围内的准确率达到 93%——优于独立使用的 LLM 和 NER。代码可在以下地址获取:https://github.com/otmive/llama_reports
引用
@article{arxiv.2510.03102,
title = {Semantic Similarity in Radiology Reports via LLMs and NER},
author = {Beth Pearson and Ahmed Adnan and Zahraa S. Abdallah},
journal= {arXiv preprint arXiv:2510.03102},
year = {2025}
}