评估跨语言迁移的平衡数据方法:绘制语言血库图谱
计算与语言
2022-05-10 v1 人工智能
摘要
我们表明,预训练语言的选择会影响基于 BERT 的模型的下游跨语言迁移。我们在平衡数据条件下考察零样本性能以缓解数据规模混淆,将提升下游性能的预训练语言归类为供体,将零样本性能得到提升的语言归类为受体。我们开发了一种在语言数量上具二次时间复杂度的方法来估计这些关系,而非对所有可能组合进行指数级穷举计算。我们发现,我们的方法在涵盖不同语言特征及两项下游任务的多样化语言集上有效。我们的发现可为大规模多语言语言模型的开发者选择更优预训练配置提供参考。
引用
@article{arxiv.2205.04086,
title = {A Balanced Data Approach for Evaluating Cross-Lingual Transfer: Mapping the Linguistic Blood Bank},
author = {Dan Malkin and Tomasz Limisiewicz and Gabriel Stanovsky},
journal= {arXiv preprint arXiv:2205.04086},
year = {2022}
}
备注
Accepted to NAACL 2022