中文

荷兰语医学实体链接:基于自动生成的维基百科语料对自对齐 BERT 模型进行微调

计算与语言 2024-05-21 v1

摘要

医学实体链接作为自动从健康相关文本中进行信息抽取的关键组成部分,在将文本中的实体(如疾病、药物和身体部位)连接到结构化医学知识库中对应的概念方面发挥着重要作用。尽管近期在自然语言处理方面取得了进展,该任务仍然具有挑战性。本文提出了首个为荷兰语评估的医学实体链接模型。我们采用 MedRoBERTa.nl 作为基础模型,并通过自对齐方式对从 UMLS 和荷兰语 SNOMED 中提取的荷兰语医学本体进行二级预训练。我们从维基百科派生出与本体关联的荷兰语医学实体语料,并在该数据集上进行模型微调。我们在荷兰语部分的 Mantra GSC 语料上进行评估,实现了 54.7% 的分类准确率和 69.8% 的 1-distance 准确率。随后我们对 unlabeled、患者支持论坛数据进行案例研究,表明模型受制于前置实体识别步骤的质量有限。小样本人工评估表明,约 65% 的正确抽取实体被正确链接到本体中的正确概念。我们的结果表明,尽管荷兰语之外的医学实体链接仍具有挑战性,但我们的荷兰语模型可用于对患者生成文本进行高层次分析。

关键词

引用

@article{arxiv.2405.11941,
  title  = {Biomedical Entity Linking for Dutch: Fine-tuning a Self-alignment BERT Model on an Automatically Generated Wikipedia Corpus},
  author = {Fons Hartendorp and Tom Seinen and Erik van Mulligen and Suzan Verberne},
  journal= {arXiv preprint arXiv:2405.11941},
  year   = {2024}
}

备注

Published in the CL4Health workshop on Patient-oriented language processing @ LREC-COLING 2024