中文

面向命名实体与形态学的神经建模(NEMO^2)

计算与语言 2021-09-14 v2

摘要

命名实体识别(NER)是一项基础NLP任务,通常被表述为对词符序列的分类。形态丰富语言(MRLs)对这一基本表述提出了挑战,因为命名实体的边界不一定与词符边界重合,而是遵循形态边界。为解决MRLs中的NER问题,我们需要回答两个基本问题:即待标注的基本单元是什么,以及在真实场景中(即无黄金形态标注可用时)如何检测并分类这些单元。我们在一个新颖的NER基准上对这些问题进行实证探究,该基准具有并行的词符级与语素级NER标注,我们为现代希伯来语——一种形态丰富且歧义的语言——开发了此基准。我们的结果表明,显式建模形态边界可提升NER性能,且一种新颖的混合架构(其中NER先于形态分解并对其进行剪枝)大幅优于标准流水线(形态分解严格先于NER),为希伯来语NER与希伯来语形态分解任务均树立了新的性能标杆。

关键词

引用

@article{arxiv.2007.15620,
  title  = {Neural Modeling for Named Entities and Morphology (NEMO^2)},
  author = {Dan Bareket and Reut Tsarfaty},
  journal= {arXiv preprint arXiv:2007.15620},
  year   = {2021}
}

备注

Accepted to TACL. This is a pre-MIT Press publication version