共享嵌入空间中跨语言性的大规模多语言分析
计算与语言
2021-09-15 v1 人工智能
机器学习
摘要
在跨语言语言模型中,许多不同语言的表示存在于同一空间中。在此,我们研究了影响 101 种语言和 5050 个语言对在句子级对齐的语言学与非语言学因素,所用模型为基于 BERT 的 LaBSE 和基于 BiLSTM 的 LASER,语料为圣经。我们以双语文本检索性能的形式计算了一种基于任务的跨语言对齐度量,以及四种向量空间对齐与同构的内在度量。随后,我们考察了一系列语言学、准语言学及与训练相关的特征,作为这些对齐度量的潜在预测因子。分析结果表明,词序一致性和形态复杂度一致性是跨语言性最强的语言学预测因子之二。我们还注意到,跨语系训练数据在整个范围内是比语言特定训练数据更强的预测因子。我们通过考察形态分割对英语-因纽特语对齐的影响,以及考察词序一致性对来自另一语料库的 66 个零样本语言对同构的影响,验证了部分语言学发现。我们将实验的数据与代码公开可用。
引用
@article{arxiv.2109.06324,
title = {A Massively Multilingual Analysis of Cross-linguality in Shared Embedding Space},
author = {Alex Jones and William Yang Wang and Kyle Mahowald},
journal= {arXiv preprint arXiv:2109.06324},
year = {2021}
}
备注
15 pages, 8 figures, EMNLP 2021