中文

识别 BERT 多语言性所需的要素

计算与语言 2021-02-09 v3

摘要

已有研究表明,多语言 BERT(mBERT)能产生高质量的多语言表示并实现有效的零样本迁移。考虑到 mBERT 在训练时未使用任何跨语言信号,这一现象令人惊讶。尽管近期文献已研究该现象,多语言性的成因仍有些模糊。我们旨在识别 BERT 的架构特性与语言的语言学特性中,使 BERT 成为多语言模型所必需的要素。为支持快速实验,我们提出了一种高效设置:使用在合成与自然混合数据上训练的小型 BERT 模型。总体而言,我们识别出影响多语言性的四种架构要素与两种语言学要素。基于我们的发现,我们尝试了一种多语言预训练设置,使用 VecMap(即无监督嵌入对齐)修改掩码策略。在 XNLI 上以三种语言进行的实验表明,我们的发现可从小规模设置迁移至更大规模设置。

关键词

引用

@article{arxiv.2005.00396,
  title  = {Identifying Necessary Elements for BERT's Multilinguality},
  author = {Philipp Dufter and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2005.00396},
  year   = {2021}
}

备注

EMNLP2020 CRV