基于真大小写还原预训练的鲁棒命名实体识别
计算与语言
2019-12-17 v1
摘要
尽管现代命名实体识别(NER)系统在标准数据集上表现出令人印象深刻的性能,但在面对含噪声数据时表现不佳。特别地,大小写在许多语言中是实体的强信号,即便最先进的模型也会对此特征过拟合,在无非首字母大写文本上性能急剧下降。本工作中,我们针对具有噪声或不确定大小写数据中NER系统的鲁棒性问题,采用一种预测文本中大小写的预训练目标,即真大小写还原器(truecaser),并利用无标注数据。预训练的真大小写还原器通过将其输出分布追加到字符嵌入上,与标准BiLSTM-CRF模型结合用于NER。在多个具有不同领域和大小写质量的数据集上的实验中,我们表明我们的新模型提升了在无大小写文本上的性能,甚至为无大小写BERT嵌入增添了价值。我们的方法在WNUT17共享任务数据集上达到了新的最先进水平(state of the art)。
引用
@article{arxiv.1912.07095,
title = {Robust Named Entity Recognition with Truecasing Pretraining},
author = {Stephen Mayhew and Nitish Gupta and Dan Roth},
journal= {arXiv preprint arXiv:1912.07095},
year = {2019}
}
备注
Accepted to AAAI 2020