面向多语言模型预训练的软语言聚类
计算与语言
2023-06-14 v1
摘要
多语言预训练语言模型已展现出令人印象深刻的(零样本)跨语言迁移能力,然而当目标语言与源语言在类型学上相距甚远或预训练数据规模有限时,其性能会受限。在本文中,我们提出 XLM-P,它上下文地检索提示作为对实例进行条件式编码的灵活引导。我们的 XLM-P 实现了(1)跨语言的语言不变与语言特定知识的轻量级建模,以及(2)与其他多语言预训练方法的轻松集成。在 XTREME 的任务(包括文本分类、序列标注、问答和句子检索)上,采用我们所提方法预训练的 base 与 large 规模语言模型均展现出一致的性能提升。此外,它为无监督句子检索中的低资源语言以及跨语言迁移中与源语言差异极大的目标语言提供了显著优势。
引用
@article{arxiv.2306.07610,
title = {Soft Language Clustering for Multilingual Model Pre-training},
author = {Jiali Zeng and Yufan Jiang and Yongjing Yin and Yi Jing and Fandong Meng and Binghuai Lin and Yunbo Cao and Jie Zhou},
journal= {arXiv preprint arXiv:2306.07610},
year = {2023}
}