中文

基于自注意力与预训练的多语言成分句法分析

计算与语言 2019-06-05 v2

摘要

我们展示了成分句法分析在多种语言和一系列预训练条件下从无监督预训练中获益。我们首先比较了无预训练、fastText、ELMo和BERT对英语的益处,发现BERT优于ELMo,很大程度上由于增大的模型容量,而ELMo又优于非上下文的fastText嵌入。我们还发现预训练在所有测试的11种语言中都具益处;然而,大模型尺寸(超过1亿参数)使得为每种语言训练单独模型在计算上昂贵。为弥补此不足,我们展示了联合多语言预训练与微调允许在最终模型中于十种语言间共享除极少数参数外的所有参数。与每语言微调一个模型相比,模型尺寸10倍的缩减仅导致总体3.2%的相对错误率增加。我们进一步探索联合微调的思想,并展示它给低资源语言提供了从其他语言更大数据集获益的途径。最后,我们展示了11种语言的新最优结果,包括英语(95.8 F1)和中文(91.8 F1)。

关键词

引用

@article{arxiv.1812.11760,
  title  = {Multilingual Constituency Parsing with Self-Attention and Pre-Training},
  author = {Nikita Kitaev and Steven Cao and Dan Klein},
  journal= {arXiv preprint arXiv:1812.11760},
  year   = {2019}
}

备注

ACL 2019