中文

通过多粒度嵌入和增强标注实现多级生物医学命名实体识别

计算与语言 2023-12-27 v1 人工智能 机器学习

摘要

生物医学命名实体识别(NER)是生物医学自然语言处理中的一项基本任务,用于从生物医学文本(如临床记录、科学出版物和电子健康记录)中提取相关信息。传统的生物医学NER方法主要使用传统机器学习技术,如条件随机场和支持向量机,或基于深度学习的模型,如循环神经网络和卷积神经网络。最近,基于Transformer的模型,包括BERT,已被用于生物医学NER领域,并取得了显著成果。然而,这些模型通常基于词级嵌入,限制了它们捕获字符级信息的能力,而字符级信息由于生物医学文本的高度变异性和复杂性,在生物医学NER中非常有效。为了解决这些局限性,本文提出了一种混合方法,集成了多个模型的优势。在本文中,我们提出了一种方法,利用微调的BERT提供上下文词嵌入,预训练的多通道CNN捕获字符级信息,然后使用BiLSTM+CRF进行序列标注和建模文本中单词之间的依赖关系。此外,我们还提出了一种增强的标注方法作为预处理的一部分,以增强对实体起始词的识别,从而改进多词实体的识别,这是生物医学NER中的一个常见挑战。通过集成这些模型和预处理方法,我们提出的模型有效地捕获了上下文信息和详细的字符级信息。我们在基准i2b2/2010数据集上评估了我们的模型,获得了90.11的F1分数。这些结果说明了我们提出的模型在执行生物医学命名实体识别方面的能力。

关键词

引用

@article{arxiv.2312.15550,
  title  = {Multi-level biomedical NER through multi-granularity embeddings and enhanced labeling},
  author = {Fahime Shahrokh and Nasser Ghadiri and Rasoul Samani and Milad Moradi},
  journal= {arXiv preprint arXiv:2312.15550},
  year   = {2023}
}