中文

通用与领域适配大语言模型用于胸部放射报告结构化数据提取的比较

计算与语言 2024-04-10 v3 图像与视频处理

摘要

放射科医生产生的非结构化数据在被信息系统利用时对临床照护颇具价值。然而,风格上的差异性限制了其使用。本研究比较了使用领域适配语言模型(RadLing)与通用 LLM(GPT-4)从胸部放射报告中提取相关特征并标准化为通用数据元素(CDEs)的系统。三位放射科医生标注了 1399 份胸部 X 线报告的回顾性数据集(900 训练,499 测试),并映射到 44 个预选相关 CDE。GPT-4 系统以报告、特征集、值集和动态少样本提示来提取值并映射到 CDE。输出键值对在两阶段均与参考标准比较,完全匹配视为 TP。RadLing 系统的提取 F1 得分为 97%,GPT-4 系统为 78%。映射 F1 得分 RadLing 为 98%,GPT-4 为 94%;差异具统计显著性(P<.001)。RadLing 的领域适配嵌入在特征提取上更优,其轻量映射器在 CDE 指派上 F1 更高。RadLing 系统在区分缺失(99% vs 64%)与未指定(99% vs 89%)上也展现更强能力。RadLing 系统的领域适配嵌入通过提供更相关少样本提示将 GPT-4 系统性能提升至 92%。RadLing 系统还具有本地部署与降低运行成本等操作优势。

关键词

引用

@article{arxiv.2311.17213,
  title  = {General-Purpose vs. Domain-Adapted Large Language Models for Extraction of Structured Data from Chest Radiology Reports},
  author = {Ali H. Dhanaliwala and Rikhiya Ghosh and Sanjeev Kumar Karn and Poikavila Ullaskrishnan and Oladimeji Farri and Dorin Comaniciu and Charles E. Kahn},
  journal= {arXiv preprint arXiv:2311.17213},
  year   = {2024}
}