通过预训练模块化 Transformer 破除多语诅咒
计算与语言
2022-05-13 v1
摘要
多语预训练模型已知受多语诅咒所困,即随覆盖语言增多,每语言性能下降。我们通过引入语言特定模块解决此问题,其允许我们增长模型总容量,同时保持每语言可训练参数总数恒定。与事后学习语言特定组件的先前工作不同,我们从一开始就预训练跨语言模块化(X-Mod)模型的模块。我们在自然语言推理、命名实体识别与问答上的实验表明,我们的方法不仅缓解语言间负干扰,还实现正迁移,带来单语与跨语言性能提升。此外,我们的方法支持事后添加语言且无可测性能下降,不再将模型使用限于预训练语言集合。
引用
@article{arxiv.2205.06266,
title = {Lifting the Curse of Multilinguality by Pre-training Modular Transformers},
author = {Jonas Pfeiffer and Naman Goyal and Xi Victoria Lin and Xian Li and James Cross and Sebastian Riedel and Mikel Artetxe},
journal= {arXiv preprint arXiv:2205.06266},
year = {2022}
}
备注
NAACL 2022