中文

UMLS-KGI-BERT:面向生物医学实体识别的Transformer中以数据为中心的知识集成

计算与语言 2025-04-14 v2

摘要

预训练的 transformer 语言模型(LM)近年来已成为应用自然语言处理(NLP)的主导范式。这些模型在信息抽取、问答、情感分析、文档分类等诸多任务上取得了最先进的性能。在生物医学领域,将这一范式适配于需要集成领域特定知识及语言统计建模的 NLP 任务已取得显著进展。特别是,该领域研究聚焦于如何最佳地构建不仅考虑医学文本中词符分布模式、而且考虑 UMLS 等术语资源中丰富结构化信息的 LM。本工作提出了一种以数据为中心的范式,通过从 UMLS 中提取文本序列来丰富生物医学 transformer 编码器 LM 的语言表示。这使得基于图的学习目标能够与掩码语言预训练相结合。从扩展预训练 LM 以及从头训练开展的实验初步结果表明,该框架在多个生物医学与临床命名实体识别(NER)任务的下游性能上有所提升。

关键词

引用

@article{arxiv.2307.11170,
  title  = {UMLS-KGI-BERT: Data-Centric Knowledge Integration in Transformers for Biomedical Entity Recognition},
  author = {Aidan Mannion and Thierry Chevalier and Didier Schwab and Lorraine Geouriot},
  journal= {arXiv preprint arXiv:2307.11170},
  year   = {2025}
}

备注

Addition of v2 experiments