中文

用于从诊断报告中自动提取结构化数据的语言模型与检索增强生成

计算与语言 2024-09-19 v2 信息检索 机器学习

摘要

目的:开发并评估一个自动化系统,该系统使用开放权重大型语言模型(LMs)和检索增强生成(RAG)从非结构化放射学和病理学报告中提取结构化临床信息,并评估模型配置变量对提取性能的影响。方法与材料:本研究使用了两个数据集:7294份标注了脑肿瘤报告和数据系统(BT-RADS)评分的放射学报告,以及2154份标注了异柠檬酸脱氢酶(IDH)突变状态的病理学报告。开发了一个自动化流水线以对各种 LMs 和 RAG 配置的性能进行基准测试。系统评估了模型大小、量化、提示策略、输出格式和推理参数的影响。结果:表现最佳的模型在从放射学报告中提取 BT-RADS 评分方面达到了98%以上的准确率,在从病理学报告中提取 IDH 突变状态方面达到了90%以上的准确率。表现最好的模型是经过医疗微调的 llama3。更大、更新和领域微调的模型始终优于更旧和更小的模型。模型量化对性能的影响微乎其微。少样本提示显著提高了准确率。RAG 提高了复杂病理学报告的性能,但对较短的放射学报告没有提升。结论:开放 LMs 展示了在本地隐私保护应用中从非结构化临床报告中自动提取结构化临床数据的巨大潜力。仔细的模型选择、提示工程以及使用标注数据进行半自动优化对于实现最佳性能至关重要。这些方法在研究工作流中的可靠性足以投入实际使用,突显了在医疗数据提取中人机协作的潜力。

关键词

引用

@article{arxiv.2409.10576,
  title  = {Language Models and Retrieval Augmented Generation for Automated Structured Data Extraction from Diagnostic Reports},
  author = {Mohamed Sobhi Jabal and Pranav Warman and Jikai Zhang and Kartikeye Gupta and Ayush Jain and Maciej Mazurowski and Walter Wiggins and Kirti Magudia and Evan Calabrese},
  journal= {arXiv preprint arXiv:2409.10576},
  year   = {2024}
}