中文

语料规模至关重要:用优化的大语料改进神经命名实体识别

计算与语言 2018-07-30 v1 机器学习 机器学习

摘要

本研究以德语等低资源语言为例,将神经命名实体识别的性能在 F-score 上提升了至多 11%,从而超越现有基线,并在每个单一开源数据集上确立了新的 state-of-the-art (SOTA,最优性能)。我们并非设计更深更宽的混合神经架构,而是汇集所有可用资源,并在将原始数据暴露于任何训练过程之前,执行细致的优化以及依赖于语法的形态处理,包括 lemmatization (词形还原) 与 part-of-speech tagging (词性标注)。我们在 a) 单一、b) 联合与 c) 优化训练的单语三重实验设置中测试我们的方法,并阐明下游任务对用于计算词嵌入的语料规模的依赖关系。

关键词

引用

@article{arxiv.1807.10675,
  title  = {Resource-Size matters: Improving Neural Named Entity Recognition with Optimized Large Corpora},
  author = {Sajawel Ahmed and Alexander Mehler},
  journal= {arXiv preprint arXiv:1807.10675},
  year   = {2018}
}

备注

ICMLA 2018 submission