SambaLingo: 教授大型语言模型新语言
计算与语言
2024-07-19 v2 人工智能
机器学习
摘要
尽管大型语言模型(LLM)已得到广泛使用,但其在不同语言间的能力和可用性仍存在巨大差距。解决这些问题的一种方法是采用现有的预训练 LLM 并在新语言上继续训练。尽管先前的工作已对语言适应进行了实验,但关于最佳实践和方法论的许多问题尚未被涵盖。本文对 LLM 向新语言的适应进行了全面研究。我们的研究涵盖了该过程中的关键组件,包括词汇扩展、直接偏好优化以及低资源语言中人类对齐的数据稀缺问题。我们在 9 种语言和 2 种参数规模(7B 和 70B)上对这些实验进行了扩展。我们将我们的模型与 Llama 2、Aya-101、XGLM、BLOOM 及现有的语言专家模型进行了比较,超越了所有先前发表的基线。此外,所有评估代码和检查点均已公开,以促进未来的研究。
引用
@article{arxiv.2404.05829,
title = {SambaLingo: Teaching Large Language Models New Languages},
author = {Zoltan Csaki and Bo Li and Jonathan Li and Qiantong Xu and Pian Pawakapan and Leon Zhang and Yun Du and Hengyu Zhao and Changran Hu and Urmish Thakker},
journal= {arXiv preprint arXiv:2404.05829},
year = {2024}
}
备注
23 pages