基于 BERT 嵌入的多语言临床命名实体识别:心血管文本中的疾病与药物识别
计算与语言
2025-10-21 v1
摘要
电子健康记录 (EHR) 数据的快速积累凸显了从非结构化临床文本中解锁生物医学知识的紧迫需求,以支持数据驱动的临床系统发展,包括患者诊断、疾病进程监测、治疗效果评估、预测未来临床事件等。虽然情境化语言模型在英语语料库中已展现出显著性能提升,但针对低资源语言临床文本的研究仍寥寥。为弥合这一差距,我们的研究旨在开发多个深度情境嵌入模型,以提升心血管领域的临床命名实体识别能力,这是 BioASQ MultiCardioNER 共享任务的一部分。我们探讨了不同单语言和多语言 BERT 模型的有效性,这些模型在通用领域文本上进行训练,用于从英语、西班牙语和意大利语撰写的临床病例报告中抽取疾病和药物提及。我们在西班牙语疾病识别 (SDR) 上取得 77.88% 的 F1 分数,在西班牙语药物识别 (SMR) 上取得 92.09% 的 F1 分数,在英语药物识别 (EMR) 上取得 91.74% 的 F1 分数,在意大利语药物识别 (IMR) 上取得 88.9% 的 F1 分数。这些结果超越了测试排行榜中所有子任务的平均值和中位数 F1 分数,其平均值/中位数分别为:SDR 为 69.61%/75.66%,SMR 为 81.22%/90.18%,EMR 为 89.2%/88.96%,IMR 为 82.8%/87.76%。
引用
@article{arxiv.2510.17437,
title = {Multilingual Clinical NER for Diseases and Medications Recognition in Cardiology Texts using BERT Embeddings},
author = {Manuela Daniela Danu and George Marica and Constantin Suciu and Lucian Mihai Itu and Oladimeji Farri},
journal= {arXiv preprint arXiv:2510.17437},
year = {2025}
}
备注
11 pages, 5 figures, 1 table, published in Working Notes of the Conference and Labs of the Evaluation Forum (CLEF 2024)