使用单一源语言大规模语料库机器翻译进行多语言预训练
计算与语言
2024-11-07 v2
摘要
英语作为一种资源非常丰富的语言,能够支持高质量大语言模型(LLM)的预训练。但对于大多数其他语言而言,情况并非如此,因为领先的LLM在非英语语言上仍然表现不佳,这可能是由于可用的多语言预训练语料库在质量和多样性方面存在差距。在这项工作中,我们发现来自单一高质量源语言的机器翻译文本可以显著促进多语言LLM的预训练。我们将高质量的英语网络数据集FineWeb-Edu翻译成法语、德语和西班牙语,最终得到一个3000亿token的数据集,我们称之为TransWeb-Edu,并在此数据集上从头预训练了一个13亿参数的模型CuatroLLM。在五项非英语推理任务中,我们表明CuatroLLM的性能与使用封闭数据训练的最先进多语言模型(如Llama3.2和Gemma2)相当或更优,尽管使用的数据量少了一个数量级,例如仅约为Llama3.2训练所用token的6%。我们进一步证明,通过额外的领域特定预训练(其数据量不到TransWeb-Edu的1%),CuatroLLM在多语言推理方面超越了当前最先进水平。为促进可复现性,我们在hf.co/britllm/CuatroLLM上以开放许可发布了我们的语料库、模型和训练流程。
引用
@article{arxiv.2410.23956,
title = {Multilingual Pretraining Using a Large Corpus Machine-Translated from a Single Source Language},
author = {Jiayi Wang and Yao Lu and Maurice Weber and Max Ryabinin and Yihong Chen and Raphael Tang and Pontus Stenetorp},
journal= {arXiv preprint arXiv:2410.23956},
year = {2024}
}