中文

面向噪声用户生成文本的词性标注的域自适应

计算与语言 2019-05-23 v1 机器学习 机器学习

摘要

词性(POS)标注器的性能高度依赖于所处理文本的域,且许多域可用训练数据极少甚至没有。本文研究使用神经网络对噪声用户生成文本进行 POS 标注的问题。我们提出一种架构:在大型新闻语料上训练域外模型,并将其权重作为在目标域(一个标注极少的德语推文数据集)上训练模型的先验进行迁移。该神经网络核心为两个标准双向 LSTM。然而,我们发现编码一组任务特定特征以及获得可靠的(源域与目标域)词表示至关重要。我们开展了采用早停、dropout 和微调域自适应先验权重等不同正则化技术的实验。我们的最佳模型使用了来自域外模型的外部权重,以及特征嵌入、预训练词与子词嵌入,达到了略高于 90% 的标注准确率,改进了该任务上先前的 SOTA。

关键词

引用

@article{arxiv.1905.08920,
  title  = {Domain adaptation for part-of-speech tagging of noisy user-generated text},
  author = {Luisa März and Dietrich Trautmann and Benjamin Roth},
  journal= {arXiv preprint arXiv:1905.08920},
  year   = {2019}
}

备注

6 pages, NAACL 2019