无标注数据的命名实体识别:一种弱监督方法
计算与语言
2020-05-01 v1 机器学习
机器学习
摘要
命名实体识别(NER)性能在应用于与训练时所见文本不同的目标领域时往往会迅速下降。当存在领域内标注数据时,可使用迁移学习技术将已有的 NER 模型适配到目标领域。但当目标领域没有人工标注数据时该怎么办?本文提出了一种简单而强大的方法,通过弱监督在无标注数据情况下学习 NER 模型。该方法依赖广泛的标注函数自动标注来自目标领域的文本。随后使用隐马尔可夫模型将这些标注合并,该模型捕捉了各标注函数不同的准确率与混淆情况。最终可基于此统一标注训练一个序列标注模型。我们在两个英文数据集(CoNLL 2003 以及来自 Reuters 和 Bloomberg 的新闻文章)上评估了该方法,并展示出相比域外神经 NER 模型在实体级 分数上约 7 个百分点的提升。
引用
@article{arxiv.2004.14723,
title = {Named Entity Recognition without Labelled Data: A Weak Supervision Approach},
author = {Pierre Lison and Aliaksandr Hubin and Jeremy Barnes and Samia Touileb},
journal= {arXiv preprint arXiv:2004.14723},
year = {2020}
}
备注
Accepted to ACL 2020 (long paper)