PharmKE:基于迁移学习的药物文本知识抽取平台
计算与语言
2023-01-10 v1 机器学习
摘要
给定文本中命名实体识别的挑战近年来一直是非常活跃的领域。这归因于神经网络架构的进步、计算能力的提升以及多样化标注数据集的可用,这些提供了预训练的高精度模型。这些任务通常聚焦于标注常见实体,但领域特定用例需要标注不属于预训练模型的自定义实体。这可通过微调预训练模型或训练自定义模型来解决。主要挑战在于获取可靠的标注训练与测试数据集,而人工标注将是一项极为繁琐的任务。本文中我们提出 PharmKE,一个聚焦于药物领域的文本分析平台,其通过多个阶段应用深度学习对药物文章进行透彻的语义分析。它使用最先进的迁移学习模型进行文本分类,并通过所提方法学彻底整合所获得的结果。该方法学用于创建精确标注的训练与测试数据集,随后用于训练以药物领域为中心的自定义实体标注任务模型。所得结果与在相同数据集上训练的微调 BERT 和 BioBERT 模型进行比较。此外,PharmKE 平台整合命名实体识别任务所得结果以消解实体共指并分析每句中的语义关系,从而为问答与事实抽取等附加文本分析任务建立基线。所识别实体还用于扩展由 DBpedia Spotlight 为给定药物文本生成的知识图谱。
引用
@article{arxiv.2102.13139,
title = {PharmKE: Knowledge Extraction Platform for Pharmaceutical Texts using Transfer Learning},
author = {Nasi Jofche and Kostadin Mishev and Riste Stojanov and Milos Jovanovik and Dimitar Trajanov},
journal= {arXiv preprint arXiv:2102.13139},
year = {2023}
}