利用大语言模型改进药物识别在过量死亡监测中
摘要
美国与药物相关死亡的上升率主要由非法药物所致,亟需及时准确的监测。然而,关键的过量死亡数据常常隐藏在自由文本的刑事报告中,导致编码为 ICD-10 分类时信息丢失和延迟。自然语言处理 (NLP) 模型可能自动化和增强过量死亡监测,但以前的应用受限。使用来自多个美国司法管辖区的 2020 年 35,433 例死亡记录的 dataset 用于模型训练和内部测试。外部验证使用 2023-2024 年的 3,335 条独立记录进行。评估了多种 NLP 方法用于从非结构化死亡证书文本中对特定药物涉及进行分类。这包括传统的单标签和多标签分类器,以及细化的编码器-only 语言模型,如双向编码器表示转换 (BERT) 和 BioClinicalBERT,以及当代解码器-only 大语言模型,如 Qwen 3 和 Llama 3。通过宏平均 F1 分数评估模型性能,并计算 95% 置信区间以量化不确定性。细化的 BioClinicalBERT 模型实现了接近完美的性能,在内部测试集上的宏 F1 分数 >=0.998。外部验证确认了鲁棒性 (宏 F1=0.966),优于传统机器学习、通用领域 BERT 模型和各种解码器-only 大语言模型。NLP 模型,特别是细化的临床变体如 BioClinicalBERT,为从自由文本报告中进行过量死亡分类提供了高度准确和可扩展的解决方案。这些方法可以显著加速监测工作流程,克服手动 ICD-10 编码的局限性,支持近实时检测新兴物质使用趋势。
引用
@article{arxiv.2507.12679,
title = {Improving Drug Identification in Overdose Death Surveillance using Large Language Models},
author = {Arthur J. Funnell and Panayiotis Petousis and Fabrice Harel-Canada and Ruby Romero and Alex A. T. Bui and Adam Koncsol and Hritika Chaturvedi and Chelsea Shover and David Goodman-Meza},
journal= {arXiv preprint arXiv:2507.12679},
year = {2025}
}
备注
30 pages, 1 figure, 4 tables, 2 supplemental figures, 4 supplemental tables, submitted to Journal of Forensic Sciences (JFS)