利用词嵌入进行在线媒体中命名实体识别的域适应
计算与语言
2016-12-02 v1 信息检索
摘要
互联网上的内容是异构的,来自新闻、娱乐、金融和技术等不同域。理解此类内容需要识别命名实体(人物、地点和组织)作为关键步骤之一。传统上命名实体识别(Named Entity Recognition, NER)系统已使用可用的标注数据集(如 CoNLL、MUC)构建并展现出优异性能。然而,这些模型无法泛化到其他域如体育和金融,其中约定和语言使用可能显著不同。此外,若干域没有大量标注标记数据来训练鲁棒的命名实体识别模型。应对这一挑战的关键步骤是将在具有大量标注训练数据的域上学习的模型适应到具有稀缺标注数据的域。在本文中,我们提出有效的方法,使用分布式词表示将在某一域上学习的模型适应到其他域。首先我们分析跨域存在的语言变体以识别可提升跨域性能的关键语言洞察。我们提出方法捕获除了全局语义之外的词使用的域特定语义。然后我们展示如何有效使用此类域特定知识来学习在域适应设置中优于先前基线的 NER 模型。
引用
@article{arxiv.1612.00148,
title = {Domain Adaptation for Named Entity Recognition in Online Media with Word Embeddings},
author = {Vivek Kulkarni and Yashar Mehdad and Troy Chevalier},
journal= {arXiv preprint arXiv:1612.00148},
year = {2016}
}
备注
12 pages, 3 figures, 8 tables arxiv preprint