开发与验证用于生成完全结构化放射学报告的大型语言模型
人工智能
2025-09-29 v3 计算与语言
摘要
当前用于创建完全结构化报告的大型语言模型(LLM)在将数据上传至外部服务器时面临格式错误、内容幻觉和隐私泄露等挑战。我们旨在开发一个开源、准确的LLM,用于从不同机构的各式自由文本报告中生成完全结构化和标准化的LCS报告,并展示其在自动统计分析和单个肺结节检索中的实用性。经过伦理委员会批准,我们的回顾性研究包括来自两家机构的5,442份去标识化LDCT LCS放射学报告。我们通过标注500对自由文本和完全结构化放射学报告,以及从2021年1月至2023年12月构建了两个评估数据集。两位放射科医生创建了记录27项肺结节特征的标准化模板。我们设计了一种动态模板约束解码方法,以增强现有LLM在从自由文本放射学报告中创建完全结构化报告方面的能力。利用连续结构化报告,我们自动化了描述性统计分析和一个结节检索原型。我们最佳的用于创建完全结构化报告的LLM在跨机构数据集上取得高性能,F1分数约为97%,且没有格式错误或内容幻觉。我们的方法将最佳开源LLM的性能提升了最高可达10.42%,并以17.19%的优势超越GPT-4o。自动推导出的统计分布与先前关于衰减、位置、大小、稳定性和Lung-RADS的发现相一致。具有结构化报告的检索系统允许灵活的结节级别搜索和复杂的统计分析。我们开发的软件已公开提供,可供本地部署和进一步研究。
引用
@article{arxiv.2409.18319,
title = {Development and Validation of a Large Language Model for Generating Fully-Structured Radiology Reports},
author = {Chuang Niu and Md Sayed Tanveer and Md Zabirul Islam and Parisa Kaviani and Qing Lyu and Mannudeep K. Kalra and Christopher T. Whitlow and Ge Wang},
journal= {arXiv preprint arXiv:2409.18319},
year = {2025}
}