中文

多语言编码器如何学习跨语言表示?

计算与语言 2022-07-13 v1

摘要

NLP系统通常需要支持一种以上语言。由于不同语言拥有的监督量不同,跨语言迁移通过从其他语言迁移,惠及训练数据极少或没有训练数据的语言。从工程角度看,多语言NLP通过以单一系统服务多种语言,有益于开发与维护。跨语言迁移与多语言NLP均依赖作为基础的跨语言表示。由于BERT革新了表示学习与NLP,它也革新了跨语言表示与跨语言迁移。多语言BERT作为单语言BERT的替代发布,使用104种语言的维基百科数据训练。令人惊讶的是,在没有任何显式跨语言信号的情况下,多语言BERT除了各语言的表示外,还学到了跨语言表示。本论文首先在各种任务上对比先前工作展示了这种令人惊讶的跨语言有效性。自然地,这引出了一系列问题,最显著的是这些多语言编码器如何学习跨语言表示。在探索这些问题时,本论文将分析多语言模型在高资源与低资源语言多种设定下的行为。我们也考察如何向多语言编码器中注入不同的跨语言信号,以及这些模型的跨语言迁移的优化行为。它们共同增进了对多语言编码器在跨语言迁移上的理解。我们的发现将引导我们提出对多语言编码器与跨语言迁移的改进建议。

关键词

引用

@article{arxiv.2207.05737,
  title  = {How Do Multilingual Encoders Learn Cross-lingual Representation?},
  author = {Shijie Wu},
  journal= {arXiv preprint arXiv:2207.05737},
  year   = {2022}
}

备注

Ph.D. thesis. Defended Nov 2021. Readers: Mark Dredze, Benjamin Van Durme, Jo\~ao Sedoc