中文

面向生物医学文本的知识引导命名实体识别

计算与语言 2020-09-21 v4 信息检索 机器学习

摘要

在这项工作中,我们将 NER 任务形式化为一个多答案知识引导问答任务(KGQA),其仅通过分配 B、I 和 O 标签来预测实体,而不将实体类型与标签关联。我们提供不同的知识上下文,例如实体类型、问题、定义和示例,连同文本一起,并在由 18 个生物医学语料库组成的组合数据集上进行训练。这种形式化方法(a)使系统能够从不同的 NER 数据集中联合学习 NER 特定特征,(b)可以使用知识-文本注意力来识别与所提供知识具有更高相似度的词,从而提升性能,(c)通过将预测类别仅减少为 B、I、O 来降低系统混淆,以及(d)使嵌套实体的检测更容易。我们在 18 个生物医学 NER 数据集上对该 KGQA 形式化进行了大量实验,并通过实验注意到知识有助于实现更好的性能。我们的问题形式化能够在 12 个数据集中达到 SOTA 结果。

关键词

引用

@article{arxiv.1911.03869,
  title  = {Knowledge Guided Named Entity Recognition for BioMedical Text},
  author = {Pratyay Banerjee and Kuntal Kumar Pal and Murthy Devarakonda and Chitta Baral},
  journal= {arXiv preprint arXiv:1911.03869},
  year   = {2020}
}

备注

6 pages, 2 figures, 5 tables, WIP