中文

通过对抗训练实现鲁棒的多语言词性标注

计算与语言 2018-04-23 v2 机器学习

摘要

对抗训练(AT)是一种针对神经网络的强大正则化方法,旨在实现对输入扰动的鲁棒性。然而,在自然语言处理背景下,由 AT 获得的鲁棒性的具体效果仍不清楚。在本文中,我们提出并分析了一个利用 AT 的神经词性标注模型。在 Penn Treebank WSJ 语料库和 Universal Dependencies(UD)数据集(27 种语言)上的实验中,我们发现 AT 不仅提高了整体标注准确率,而且 1)在低资源语言中很好地防止过拟合,2)提升了罕见/未登录词的标注准确率。我们还证明 3)AT 带来的标注性能提升有助于下游的依赖解析任务,且 4)AT 帮助模型学习更干净的词语表示。5)所提出的 AT 模型在不同的序列标注任务中普遍有效。这些积极结果激励了在自然语言任务中进一步使用 AT。

关键词

引用

@article{arxiv.1711.04903,
  title  = {Robust Multilingual Part-of-Speech Tagging via Adversarial Training},
  author = {Michihiro Yasunaga and Jungo Kasai and Dragomir Radev},
  journal= {arXiv preprint arXiv:1711.04903},
  year   = {2018}
}

备注

NAACL 2018