面向噪声用户生成文本的词性标注的域自适应
计算与语言
2019-05-23 v1 机器学习
机器学习
摘要
词性(POS)标注器的性能高度依赖于所处理文本的域,且许多域可用训练数据极少甚至没有。本文研究使用神经网络对噪声用户生成文本进行 POS 标注的问题。我们提出一种架构:在大型新闻语料上训练域外模型,并将其权重作为在目标域(一个标注极少的德语推文数据集)上训练模型的先验进行迁移。该神经网络核心为两个标准双向 LSTM。然而,我们发现编码一组任务特定特征以及获得可靠的(源域与目标域)词表示至关重要。我们开展了采用早停、dropout 和微调域自适应先验权重等不同正则化技术的实验。我们的最佳模型使用了来自域外模型的外部权重,以及特征嵌入、预训练词与子词嵌入,达到了略高于 90% 的标注准确率,改进了该任务上先前的 SOTA。
引用
@article{arxiv.1905.08920,
title = {Domain adaptation for part-of-speech tagging of noisy user-generated text},
author = {Luisa März and Dietrich Trautmann and Benjamin Roth},
journal= {arXiv preprint arXiv:1905.08920},
year = {2019}
}
备注
6 pages, NAACL 2019