超越以英语为中心的双语文本以获得更好的多语言表示学习
计算与语言
2022-10-27 v1 机器学习
摘要
在本文中,我们详细阐述了构建多语言表示模型的方案,这些模型不仅与现有的 SOTA 模型相竞争,而且参数效率更高,从而促进了在资源受限场景和实际应用中的更好采用。我们表明,超越以英语为中心的双语文本,结合旨在减少训练数据未充分利用的新型采样策略,可大幅提升 Electra 和 MLM 预训练目标在所有模型规模下的性能。我们引入了 XY-LENT:使用 Transformer 的 X-Y 双语文本增强语言编码,它不仅在所有模型规模范围内实现了 5 项跨语言任务的 SOTA 性能,而且在各规模范围内均具竞争力。我们的 XY-LENT XL 变体优于 XLM-RXXL,并与 mT5 XXL 表现出相当的性能,而其规模分别仅为后两者的 1/5 和 1/6。然后我们表明,我们提出的方法有助于缓解多语言诅咒,XY-LENT XL 在相同规模范围内与 SOTA 纯英语模型相比,实现了 99.3% 的 GLUE 性能和 98.5% 的 SQuAD 2.0 性能。随后我们分析了模型在极低资源语言上的性能,并提出仅靠缩放可能不足以改善此场景下的性能。
引用
@article{arxiv.2210.14867,
title = {Beyond English-Centric Bitexts for Better Multilingual Language Representation Learning},
author = {Barun Patra and Saksham Singhal and Shaohan Huang and Zewen Chi and Li Dong and Furu Wei and Vishrav Chaudhary and Xia Song},
journal= {arXiv preprint arXiv:2210.14867},
year = {2022}
}
备注
Work in progress