中文

基于知识库引导的文档级临床实体与关系抽取

计算与语言 2024-07-16 v1 人工智能

摘要

生成式预训练变换器(GPT)模型因其精确的抽取和上下文理解能力,在临床实体和关系抽取任务中显示出前景。在本工作中,我们进一步利用统一医学语言系统(UMLS)知识库准确识别医学概念并提高文档级别的临床实体和关系抽取。我们的框架选择与文本相关的UMLS概念并将其与提示结合,以指导语言模型进行实体抽取。我们的实验表明,与不利用UMLS的少样本抽取任务相比,这一初始概念映射和包含这些映射概念的提示的包含显著改善了抽取结果。进一步地,我们的结果表明,这种方法比标准检索增强生成(RAG)技术更有效,后者将检索数据与提示嵌入进行比较以生成结果。总体而言,我们发现将UMLS概念与GPT模型集成显著提高了实体和关系识别,超越了基线和RAG模型。通过将知识库方法如UMLS的精确概念映射能力与GPT的上下文理解能力相结合,我们的方法凸显了这些方法在医疗保健等专业领域的潜力。

关键词

引用

@article{arxiv.2407.10021,
  title  = {Document-level Clinical Entity and Relation Extraction via Knowledge Base-Guided Generation},
  author = {Kriti Bhattarai and Inez Y. Oh and Zachary B. Abrams and Albert M. Lai},
  journal= {arXiv preprint arXiv:2407.10021},
  year   = {2024}
}

备注

Accepted at Association for Computational Linguistics BioNLP 2024