大语言模型基 uncertainty-adjusted 人工智能模型开发中上臂放射术图标签提取
摘要
目标:评估 GPT-4o 从自由文本放射学报告中提取带有不确定性诊断标签的能力,并测试这些标签如何影响肌肉骨骼放射术图的多标签图像分类。方法:本回顾性研究包括 clavicle(n=1,170)、elbow(n=3,755)和 thumb(n=1,978)的放射术系列。匿名化后,GPT-4o 通过指示影像发现为存在("true")、不存在("false")或 "uncertain" 来填写结构化模板。为评估标签不确定性的影响,训练和验证集中的 "uncertain" 标签自动重新分配为 "true"(包含)或 "false"(排除)。使用 ResNet50 对标签-图像-对进行多标签分类。标签提取准确性在内部(clavicle:n=233,elbow:n=745,thumb:n=393)和外部测试集(每个 n=300)上进行了手动验证。采用宏平均受体折线特征曲线(AUC)、精确召回曲线、灵敏度、特异度和准确率评估性能。使用 DeLong 检验比较 AUC。结果:在测试集中,自动提取在 98.6%(61,488 个标签中正确)的标签中准确。对于解剖区域,基于标签的模型训练在包含(例如,elbow:AUC=0.80[范围,0.62-0.87])和排除(elbow:AUC=0.80[范围,0.61-0.88])模型中实现了具竞争力的性能。模型在外部数据集上得到良好泛化(elbow[包含]:AUC=0.79[范围,0.61-0.87];elbow[排除]:AUC=0.79[范围,0.63-0.89])。在标记策略或数据集之间未观察到显著差异(p>=0.15)。结论:GPT-4o 从放射学报告中提取标签,以训练具有高准确性的多标签分类模型。检测到的放射学报告中的不确定性未影响这些模型的性能。
引用
@article{arxiv.2510.05664,
title = {Large Language Model-Based Uncertainty-Adjusted Label Extraction for Artificial Intelligence Model Development in Upper Extremity Radiography},
author = {Hanna Kreutzer and Anne-Sophie Caselitz and Thomas Dratsch and Daniel Pinto dos Santos and Christiane Kuhl and Daniel Truhn and Sven Nebelung},
journal= {arXiv preprint arXiv:2510.05664},
year = {2025}
}
备注
28 pages, 6 figures