中文

E-NER——一个带标注的法律文本命名实体识别语料库

计算与语言 2022-12-20 v1

摘要

在文档中识别人名、地名或机构名等命名实体,可以为读者突出显示关键信息。训练命名实体识别(NER)模型需要一个带标注的数据集,这可能是一项耗时且劳动密集的任务。尽管如此,已有公开可用的通用英语NER数据集。最近,人们对开发面向法律文本的NER产生了兴趣。然而,先前的工作和本文报告的实验结果表明,将在通用英语数据集上训练的NER方法应用于法律文本时,性能会显著下降。我们描述了一个公开可用的法律NER数据集,名为E-NER,它基于可从美国证券交易委员会EDGAR数据集中获取的法律公司文件。在通用英语CoNLL-2003语料库上训练多种不同的NER算法,但在我们的测试集上进行测试,结果证实,与在E-NER集合上训练和测试相比,以F1分数衡量的准确率显著下降了29.4%至60.4%。

关键词

引用

@article{arxiv.2212.09306,
  title  = {E-NER -- An Annotated Named Entity Recognition Corpus of Legal Text},
  author = {Ting Wai Terence Au and Ingemar J. Cox and Vasileios Lampos},
  journal= {arXiv preprint arXiv:2212.09306},
  year   = {2022}
}

备注

5 pages, 3 figures, submitted to NLLP workshop in EMNLP 2022