中文

多语言 BERT 中各种语言是否生而平等?

计算与语言 2020-10-02 v2

摘要

在 104 种语言上训练的多语言 BERT(mBERT)在多项 NLP 任务上展现出惊人的跨语言性能,即便没有显式的跨语言信号。然而,这些评测聚焦于高资源语言的跨语言迁移,仅覆盖了 mBERT 所涵盖语言的三分之一。我们探索 mBERT 在更广泛语言集合上的表现,重点关注以语言内性能衡量的低资源语言表征质量。我们考虑三项任务:命名实体识别(99 种语言)、词性标注和依存句法分析(各 54 种语言)。mBERT 在高资源语言上优于或与基线相当,但在低资源语言上表现差得多。此外,这些语言的单语 BERT 模型表现更差。若存在相似语言配对,单语 BERT 与 mBERT 之间的性能差距可缩小。我们发现,更好的低资源语言模型需要更高效的预训练技术或更多数据。

关键词

引用

@article{arxiv.2005.09093,
  title  = {Are All Languages Created Equal in Multilingual BERT?},
  author = {Shijie Wu and Mark Dredze},
  journal= {arXiv preprint arXiv:2005.09093},
  year   = {2020}
}

备注

RepL4NLP Workshop 2020 (Best Long Paper)