瘦身语言模型:通过额外预训练实现近亲语言编码器的低成本高效开发
计算与语言
2024-04-09 v1
摘要
语言模型的世界正经历动荡时期,更好、更大的模型以前所未有的速度涌现。然而,我们认为,特别是对科学界而言,参数量高达 10 亿的编码器模型仍然非常需要,其主要用途是为大型数据集合增加下游研究所需的元数据。我们通过为克罗地亚语、塞尔维亚语、波斯尼亚语和黑山语这一组关系非常密切的语言建立多样化的基准,并将从头训练的模型与通过现有多语言模型的额外预训练构建的新模型进行比较,研究了确保此类编码器模型存在的最佳方式。我们表明,即使计算量有限,通过对可用的多语言模型进行额外预训练,也可以获得与专门的从头训练模型相当的性能。我们还表明,相邻语言(在我们的例子中为斯洛文尼亚语)可以包含在额外预训练中,而最终模型的性能几乎没有损失。
引用
@article{arxiv.2404.05428,
title = {Language Models on a Diet: Cost-Efficient Development of Encoders for Closely-Related Languages via Additional Pretraining},
author = {Nikola Ljubešić and Vít Suchomel and Peter Rupnik and Taja Kuzman and Rik van Noord},
journal= {arXiv preprint arXiv:2404.05428},
year = {2024}
}