通过源自资源丰富语言的自蒸馏增强大型语言模型的多语言能力
计算与语言
2024-02-20 v1
摘要
尽管大型语言模型(LLMs)已在多语料库上进行预训练,但与少数资源丰富的语言相比,其在大多数语言上的性能仍然滞后。缓解这一问题的常见方法是将资源丰富语言的训练数据翻译成其他语言,然后继续训练。然而,仅依赖翻译获得的数据而忽略 LLMs 跨语言的原始能力并不总是有效的,我们将证明这会限制跨语言知识转移的性能。在本工作中,我们提出了 SDRRL,一种基于源自资源丰富语言的自蒸馏(Self-Distillation from Resource-Rich Languages)的方法,通过利用 LLMs 在资源丰富语言上的内部能力,有效提升了多语言性能。我们在不同的 LLMs(LLaMA-2 和 SeaLLM)及源语言上,针对各种理解和生成任务进行了评估,实验结果表明,SDRRL 能显著增强多语言能力,同时最小化对资源丰富语言原始性能的影响。
引用
@article{arxiv.2402.12204,
title = {Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages},
author = {Yuanchi Zhang and Yile Wang and Zijun Liu and Shuo Wang and Xiaolong Wang and Peng Li and Maosong Sun and Yang Liu},
journal= {arXiv preprint arXiv:2402.12204},
year = {2024}
}