单语基础模型的双语适应
计算与语言
2024-07-29 v2 人工智能
摘要
我们提出了一种将单语大型语言模型(LLM)适应到另一种语言的高效方法,以解决灾难性遗忘和分词器限制的挑战。本研究聚焦于将 Llama 2 适应到阿拉伯语。我们的两阶段方法从扩展词汇表并仅训练嵌入矩阵开始,随后在双语语料库上进行全模型持续预训练。通过在阿拉伯语和英语语料库的混合数据上进行持续预训练,该模型在保留其英语能力的同时,获得了阿拉伯语能力。我们的方法显著提升了阿拉伯语性能,并略微增强了英语性能,展示了具有成本效益的跨语言迁移。我们对嵌入初始化技术、数据混合比率和学习率进行了消融研究,并发布了一份详细的训练配方。为了证明此方法的泛化性,我们还将 Llama 3 8B 适应到了阿拉伯语,并将 Llama 2 13B 适应到了印地语。
引用
@article{arxiv.2407.12869,
title = {Bilingual Adaptation of Monolingual Foundation Models},
author = {Gurpreet Gosal and Yishi Xu and Gokul Ramakrishnan and Rituraj Joshi and Avraham Sheinin and Zhiming and Chen and Biswajit Mishra and Natalia Vassilieva and Joel Hestness and Neha Sengupta and Sunil Kumar Sahu and Bokang Jia and Onkar Pandit and Satheesh Katipomu and Samta Kamboj and Samujjwal Ghosh and Rahul Pal and Parvez Mullah and Soundar Doraiswamy and Mohamed El Karim Chami and Preslav Nakov},
journal= {arXiv preprint arXiv:2407.12869},
year = {2024}
}