中文

一种用于复杂生化命名实体识别的混合深度学习方法

计算与语言 2020-12-22 v1 机器学习

摘要

化学品与药物的命名实体识别(NER)是生化研究中信息抽取的关键领域。NER为生化反应中的文本挖掘提供支持,包括实体关系抽取、属性抽取和代谢响应关系抽取。然而,生物医学领域存在复杂的命名特征,如多义性和特殊字符,使得NER任务极具挑战性。在此,我们提出一种混合深度学习方法以提高NER的识别准确率。具体而言,我们的方法应用Bidirectional Encoder Representations from Transformers (BERT)模型提取文本的底层特征,通过Bi-directional Long Short-Term Memory (BILSTM)学习文本上下文的表示,并引入multi-head attention (MHATT)机制提取章节级特征。在该方法中,MHATT机制旨在提高缩写的识别准确率,以有效处理全文标签不一致的问题。此外,采用conditional random field (CRF)标注序列标签,因为该概率方法不需要严格的独立性假设,且可容纳任意上下文信息。在公开数据集上的实验评估表明,所提出的混合方法取得了最佳的识别性能;特别是与state-of-the-art方法相比,其在识别缩写、多义词和低频实体方面性能大幅提升。例如,与BILSTM-CRF算法对低频实体的识别准确率相比,该混合方法在两个实体数据集(MULTIPLE和IDENTIFIER)上的识别准确率分别提高了80%和21.69%。

关键词

引用

@article{arxiv.2012.10824,
  title  = {A hybrid deep-learning approach for complex biochemical named entity recognition},
  author = {Jian Liu and Lei Gao and Sujie Guo and Rui Ding and Xin Huang and Long Ye and Qinghua Meng and Asef Nazari and Dhananjay Thiruvady},
  journal= {arXiv preprint arXiv:2012.10824},
  year   = {2020}
}

备注

21 pages, 6 figures