语料规模至关重要:用优化的大语料改进神经命名实体识别
计算与语言
2018-07-30 v1 机器学习
机器学习
摘要
本研究以德语等低资源语言为例,将神经命名实体识别的性能在 F-score 上提升了至多 11%,从而超越现有基线,并在每个单一开源数据集上确立了新的 state-of-the-art (SOTA,最优性能)。我们并非设计更深更宽的混合神经架构,而是汇集所有可用资源,并在将原始数据暴露于任何训练过程之前,执行细致的优化以及依赖于语法的形态处理,包括 lemmatization (词形还原) 与 part-of-speech tagging (词性标注)。我们在 a) 单一、b) 联合与 c) 优化训练的单语三重实验设置中测试我们的方法,并阐明下游任务对用于计算词嵌入的语料规模的依赖关系。
引用
@article{arxiv.1807.10675,
title = {Resource-Size matters: Improving Neural Named Entity Recognition with Optimized Large Corpora},
author = {Sajawel Ahmed and Alexander Mehler},
journal= {arXiv preprint arXiv:1807.10675},
year = {2018}
}
备注
ICMLA 2018 submission