中文

利用跨度和文档级特征分类从非结构化荷兰语超声心动图报告中提取诊断

计算与语言 2025-05-22 v2 人工智能

摘要

临床机器学习研究和AI驱动的临床决策支持模型依赖于临床准确的标签。借助临床专家手动提取这些标签通常耗时且昂贵。本研究测试了从非结构化荷兰语超声心动图报告中自动进行跨度和文档级诊断提取的可行性。我们纳入了来自荷兰UMCU大型大学的115,692份非结构化超声心动图报告。随机选取的子集针对十一种常见心脏特征的出现及严重程度进行了人工标注。我们开发并测试了多种自动标注技术,涵盖跨度和文档级别,使用加权和宏F1分数、精确率和召回率进行性能评估。我们将跨度标注的性能与文档标注方法进行了比较,后者包括直接文档分类器和依赖跨度分类结果的间接文档分类器。SpanCategorizer和MedRoBERTa.nl模型分别在所有其他跨度分类器和文档分类器中表现最优。加权F1分数因特征而异,在SpanCategorizer中范围为0.60至0.93,在MedRoBERTa.nl中范围为0.96至0.98。直接文档分类优于使用跨度分类器的间接文档分类。SetFit仅使用10%的训练数据即实现了具有竞争力的文档分类性能。使用缩减的标签集可获得接近完美的文档分类结果。我们建议使用已发布的SpanCategorizer和MedRoBERTa.nl模型进行荷兰语超声心动图报告中的跨度和文档级诊断提取。在训练数据有限的场景中,SetFit可能是文档分类的有前景的替代方案。

关键词

引用

@article{arxiv.2408.06930,
  title  = {Diagnosis extraction from unstructured Dutch echocardiogram reports using span- and document-level characteristic classification},
  author = {Bauke Arends and Melle Vessies and Dirk van Osch and Arco Teske and Pim van der Harst and René van Es and Bram van Es},
  journal= {arXiv preprint arXiv:2408.06930},
  year   = {2025}
}

备注

28 pages, 5 figures