中文

RuREBus:电子政务领域联合命名实体识别与关系抽取的案例研究

计算与语言 2020-11-02 v1 计算机与社会

摘要

我们展示了一个信息抽取方法的应用案例,例如命名实体识别(NER)和关系抽取(RE),应用于一个由某国家机构发布的文档组成的新语料库。该语料库的主要挑战是:1)标注方案与通用领域语料库所使用的方案大不相同;2)文档以非英语语言撰写。与预期不同,最先进的基于Transformer的模型在两项任务上均表现出平庸的性能,无论是顺序处理还是端到端方式。我们的实验表明,在大型无标注语料库上微调并不会自动产生显著改进,因此我们可以得出结论,需要更巧妙的利用无标注文本的策略。在本文中,我们描述了所开发的完整流程,从文本标注、基线开发到设计共享任务,以期改进基线。最终,我们认识到当前的NER和RE技术远未成熟,且迄今为止未能克服像我们这样的挑战。

关键词

引用

@article{arxiv.2010.15939,
  title  = {RuREBus: a Case Study of Joint Named Entity Recognition and Relation Extraction from e-Government Domain},
  author = {Vitaly Ivanin and Ekaterina Artemova and Tatiana Batura and Vladimir Ivanov and Veronika Sarkisyan and Elena Tutubalina and Ivan Smurov},
  journal= {arXiv preprint arXiv:2010.15939},
  year   = {2020}
}

备注

to appear in AIST 2020