ChocoLlama:教羊驼学荷兰语的经验教训
计算与语言
2024-12-11 v1
摘要
尽管大型语言模型(LLMs)在自然语言理解与生成方面展现出卓越能力,但由于训练数据中的偏差,它们在资源较少的非英语语言上的表现往往较差。在本工作中,我们探索了将以英语为主的LLMs(Llama-2 和 Llama-3)适配到荷兰语的策略,荷兰语在全球有3000万使用者,但在LLM开发中常被忽视。我们从各种来源收集了 104GB 的荷兰语文本(B 个词元),首先使用低秩适配(LoRA)进行持续预训练,并辅以先前工作提供的荷兰语后训练策略。对于 Llama-2,我们考虑使用 (i) 原始模型的分词器,以及 (ii) 训练一个新的、针对荷兰语的分词器并结合嵌入重初始化。我们在标准基准和一个新颖的荷兰语基准 ChocoLlama-Bench 上评估了我们适配的模型 ChocoLlama-2。结果表明,LoRA 可以有效地扩展到语言适配,并且通过谨慎的权重重初始化来修改分词器可以提升性能。值得注意的是,Llama-3 在本项目进行期间发布,经评估,其荷兰语能力优于我们适配的 Llama-2 版本。因此,我们使用其原始分词器对 Llama-3 应用了相同的适配技术。虽然我们的适配方法增强了 Llama-2 的荷兰语能力,但我们发现将相同技术应用于 Llama-3 时收益有限。这表明,对于不断改进的多语言基础模型,语言适配技术可能更受益于专注于特定语言的后训练,而非持续预训练。我们希望这项工作有助于更广泛地理解将LLMs适配到低资源语言,并特别有助于荷兰语LLMs的发展。
引用
@article{arxiv.2412.07633,
title = {ChocoLlama: Lessons Learned From Teaching Llamas Dutch},
author = {Matthieu Meeus and Anthony Rathé and François Remy and Pieter Delobelle and Jens-Joris Decorte and Thomas Demeester},
journal= {arXiv preprint arXiv:2412.07633},
year = {2024}
}