Compass:面向东南亚的大型多语言模型
计算与语言
2024-04-16 v1
摘要
大型语言模型在拥有丰富语言资源的语言(如英语和中文)上表现出了卓越的能力。然而,当应用于语言资源有限的语言,特别是东南亚语言环境中的语言(如印度尼西亚语)时,其有效性显著下降。这些语言资源的稀缺性带来了训练不足、词汇覆盖范围受限以及评估过程困难等挑战。为应对这些迫切需求,我们推出了 CompassLLM,一个专为东南亚语言定制的大型多语言模型,其主要目标是支持 Shopee 的开发需求。我们的方法包含几个关键策略。为了逐步增强多语言能力,我们实施了与课程学习相结合的多阶段预训练策略,逐步加强对低资源语言的关注。同时,为了更好地适应低资源语言的人类指令,我们策划并生成了一个高质量的多语言人类指令库,通过有监督的指令微调最终得到 CompassLLM-SFT 模型。最后,为了加强模型与人类偏好行为的一致性,我们采用了直接偏好优化(DPO)原则,获得了 CompassLLM-DPO 模型。对 CompassLLM 模型的初步评估取得了令人鼓舞的结果,在多种评估任务中,我们的模型超越了 Vicuna-7b-v1.5、Sealion、Falcon 和 SeaLLM 等基准模型,这一点通过自动化和人工驱动的评估均得到验证。值得注意的是,我们的模型在东南亚语言(如印度尼西亚语)上表现出了卓越的性能。
引用
@article{arxiv.2404.09220,
title = {Compass: Large Multilingual Language Model for South-east Asia},
author = {Sophia Maria},
journal= {arXiv preprint arXiv:2404.09220},
year = {2024}
}