嵌入结构至关重要:多语言词表适配新语言的方法比较
计算与语言
2023-10-30 v2
摘要
预训练多语言语言模型支撑了英语之外现代 NLP 工具的大部分应用。将这些模型专门化用于特定语言的一个强基线方法是语言自适应预训练(Language-Adaptive Pre-Training, LAPT)。然而,在适配过程中保留一个大型跨语言词表与嵌入矩阵会带来相当高昂的额外计算成本。在本研究中,我们提出几种简单技术,用紧凑的、特定语言的词表替换跨语言词表。具体而言,我们探讨了在词表专门化之后重新初始化词嵌入矩阵的策略。随后,除了近期提出的 Focus 方法外,我们还对这些技术进行了系统的实验比较。我们表明:1)单语迁移文献中的嵌入替换技术不足以适配多语言模型。2)用更小的专门化词表替换跨语言词表,是一种提升低资源语言性能的高效方法。3)基于按文字系统的子分布进行的简单嵌入重新初始化技术,可与 Focus 等依赖辅助模型获得的相似度分数的技术相媲美。
引用
@article{arxiv.2309.04679,
title = {Embedding structure matters: Comparing methods to adapt multilingual vocabularies to new languages},
author = {C. M. Downey and Terra Blevins and Nora Goldfine and Shane Steinert-Threlkeld},
journal= {arXiv preprint arXiv:2309.04679},
year = {2023}
}
备注
Camera-ready for Proceedings of the 3rd Workshop on Multilingual Representation Learning