中文

基于上下文与非上下文子词表示的序列标注:一项多语言评测

计算与语言 2019-06-05 v1

摘要

预训练的上下文与非上下文子词嵌入已在超过250种语言中可用,使得大规模多语言NLP成为可能。然而,尽管预训练嵌入并不匮乏,系统性评测的明显缺失使得从业者难以在其中做出选择。在这项工作中,我们进行了广泛评测,比较非上下文子词嵌入(FastText与BPEmb)和一种上下文表示方法(BERT)在多语言命名实体识别与词性标注上的表现。我们发现总体而言,BERT、BPEmb与字符表示的组合在各类语言与任务上表现最佳。更细致的分析揭示了不同的优势与弱点:多语言BERT在中高资源语言中表现良好,但在低资源设定下被非上下文子词嵌入超越。

关键词

引用

@article{arxiv.1906.01569,
  title  = {Sequence Tagging with Contextual and Non-Contextual Subword Representations: A Multilingual Evaluation},
  author = {Benjamin Heinzerling and Michael Strube},
  journal= {arXiv preprint arXiv:1906.01569},
  year   = {2019}
}

备注

ACL 2019