中文

面向精确高效放射科报告错误检测的多 Pass 大语言模型框架

计算与语言 2025-06-26 v1

摘要

背景:大型语言模型(LLM)基于证词的阳性预测值(PPV)受限于错误悖论率低。目的:评估三 Pass LLM 框架是否提高 PPV 并降低运营成本。材料与方法:在 MIMIC-III 数据库中对 1000 份连续放射科报告(放射学 250 份、超声 250 份、CT 250 份、MRI 250 份)进行回顾性分析。两个外部数据集(CheXpert 和 Open-i)作为验证集。测试了三个 LLM 框架:(1)单提示检测器;(2)提取器加检测器;(3)提取器、检测器和误阳性验证器。测量精确度通过 PPV 和绝对阳性检出率(aTPR)实现。效率计算方式为模型推理费用和审阅员报酬。使用聚类自助法、精确 McNemar 检验和 Holm-Bonferroni 校正进行统计显著性检验。结果:框架 PPV 从 0.063(95% 置信区间 0.036-0.101,框架 1)提高至 0.079(0.049-0.118,框架 2),并显著提高至 0.159(0.090-0.252,框架 3;P<.001)。aTPR 稳定(0.012-0.014;P>=.84)。每 1000 份报告的运营成本降至美元 5.58(框架 3),较美元 9.72(框架 1)和美元 6.85(框架 2)分别降低 42.6% 和 18.5%。人工审阅报告数从 192 份降至 88 份。外部验证支持框架 3的优越 PPV(CheXpert 0.133,Open-i 0.105)和稳定 aTPR(0.007)。结论:三 Pass LLM 框架显著提高了 PPV 和降低了运营成本,同时保持检测性能,为 AI 辅助放射科报告质量保证提供了有效策略。

关键词

引用

@article{arxiv.2506.20112,
  title  = {A Multi-Pass Large Language Model Framework for Precise and Efficient Radiology Report Error Detection},
  author = {Songsoo Kim and Seungtae Lee and See Young Lee and Joonho Kim and Keechan Kan and Dukyong Yoon},
  journal= {arXiv preprint arXiv:2506.20112},
  year   = {2025}
}

备注

29 pages, 5 figures, 4 tables. Code available at https://github.com/radssk/mp-rred