基于无监督自然语言处理管道的诊疗建议适当性评估
计算与语言
2025-09-05 v2 机器学习
摘要
目的:评估诊疗建议的适当性对于提高医疗效率和减少不必要的医疗程序具有关键作用。然而,当建议原因仅以自由文本形式记录(如意大利国家卫生局的情况),这一任务就变得具有挑战性。为此,我们提出了一个完全无监督的自然语言处理(NLP)管道,能够在不依赖标注数据集的情况下提取和评估建议原因。方法:我们的管道利用预训练于意大利医学文本的基于Transformer的嵌入来聚类建议原因并评估其与适当性指南的对齐程度。该管道在无监督环境下运行,可针对不同检查类型进行推广。我们分析了来自意大利伡羌地区的两个完整区域数据集,分别覆盖2019至2021年下肢血管彩超(ECD;n=496,971;开发)和可调节结肠镜检查(FEC;n=407,949;仅测试)的所有建议。对于两者,均随机抽取1000例建议进行手动标注,以衡量性能。结果:该管道在识别建议原因方面表现良好(ECD的Prec=92.43%,FEC的Prec=93.59%;Rec=83.28%(ECD),92.70%(FEC)),在适当性评估方面也表现出色(ECD的Prec=93.58%,FEC的Prec=94.66%;Rec=91.52%(ECD),93.96%(FEC))。在区域层面,分析确定了相关不合适的建议组别以及不同情境间的差异,这些发现为伡羌地区制定新决议以强化指南遵循提供了依据。结论:本研究提出了一种稳健、可扩展的无监督NLP管道,用于对大规模真实世界数据集的建议适当性进行评估。它展示了如何有效地利用此类数据,为公共卫生当局提供了一个可部署的AI工具,以监控实践并支持基于证据的政策制定。
引用
@article{arxiv.2501.14701,
title = {An Unsupervised Natural Language Processing Pipeline for Assessing Referral Appropriateness},
author = {Vittorio Torri and Annamaria Bottelli and Michele Ercolanoni and Olivia Leoni and Francesca Ieva},
journal= {arXiv preprint arXiv:2501.14701},
year = {2025}
}
备注
49 pages, 10 figures