中文

NER-MQMRC:将命名实体识别表述为多问题机器阅读理解

机器学习 2022-05-13 v1

摘要

NER传统上被表述为序列标注任务。然而,近期出现了将NER视为机器阅读理解任务(Wang et al., 2020; Mengge et al., 2020)的趋势,其中实体名称(或其他信息)被视为问题,文本作为上下文,文本中的实体值作为答案片段。这些工作一次只考虑基于单个问题(实体)的MRC。我们提出将NER表述为多问题MRC任务,即对单条文本同时考虑多个问题(每个实体一个问题)。我们针对该表述提出了一种新颖的基于BERT的多问题MRC(NER-MQMRC)架构。NER-MQMRC架构将所有实体作为输入送入BERT,通过自注意力学习词元嵌入,并利用基于BERT的实体表示进一步改进这些用于NER任务的词元嵌入。在三个NER数据集上的评估表明,通过将全部实体在一次前向传播中共同考虑,我们提出的架构相比基于NER-SQMRC框架的模型实现了平均2.5倍的训练加速和2.3倍的推理加速。此外,我们表明相比基于单问题的MRC(NER-SQMRC)(Devlin et al., 2019),我们的模型性能未下降,在AE-Pub、Ecommerce5PT和Twitter数据集上F1分别提升+0.41%、+0.32%和+0.27%。我们提出该架构主要旨在解决大规模电商属性(或实体)抽取问题,从非结构化文本中抽取量级达5万+的属性,并在可扩展的生产环境中以高性能及优化的训练和推理耗时实现。

关键词

引用

@article{arxiv.2205.05904,
  title  = {NER-MQMRC: Formulating Named Entity Recognition as Multi Question Machine Reading Comprehension},
  author = {Anubhav Shrimal and Avi Jain and Kartik Mehta and Promod Yenigalla},
  journal= {arXiv preprint arXiv:2205.05904},
  year   = {2022}
}

备注

NAACL 2022 Industry Track