基于弱监督自然语言处理的医院出院信诊断自动识别
计算与语言
2026-01-01 v2 机器学习
摘要
从出院信中识别患者诊断对于启用大规模队列选择和流行病学研究至关重要,但传统的监督方法依赖于大量手动标注,这在大型文本数据集上往往难以实现。在本研究中,我们提出了一种 novel 的弱监督自然语言处理管道,用于对意大利语出院信进行分类,而无需手动标注。在提取与诊断相关的句子后,该方法利用基于转换器的模型,并对意大利医学文档进行额外的预训练以生成语义嵌入。对这些嵌入应用两级聚类程序,将得到的聚类映射到感兴趣的疾病,以为数据子集派生弱标签,最终用于训练基于转换器的分类器。我们在一个真实世界的案例研究中对 bronchiolitis 进行评估,该研究基于 2017 年至 2020 年意大利 Veneto 地区 44 家急诊室或医院收录的 33,176 份儿童出院信。该管道实现了面积_under 曲线(AUC)为 77.68%()和 F1 分数为 78.14%(),与手动标注进行比较。其性能超过其他无监督方法和完全监督模型,保持对聚类选择的鲁棒性,并在不同疾病类型的可扩展性方面表现出色。它每份出院信可节省约 3 分钟的专家时间,对于像我们这样的数据集可累计超过 1,500 小时。该研究表明了从意大利语出院信中识别诊断的弱监督策略是可行的。该管道实现了强大的性能,能够适用于各种疾病,并为临床文本分类提供可扩展的解决方案,减少对手动标注的需求,同时保持可靠的准确性。
引用
@article{arxiv.2410.15051,
title = {Automatic identification of diagnosis from hospital discharge letters via weakly-supervised Natural Language Processing},
author = {Vittorio Torri and Elisa Barbieri and Anna Cantarutti and Carlo Giaquinto and Francesca Ieva},
journal= {arXiv preprint arXiv:2410.15051},
year = {2026}
}
备注
49 pages, 7 figures