中文

MaLLaM——马来西亚大语言模型

计算与语言 2024-01-30 v2

摘要

为解决从零开始预训练具有马来西亚语境的大语言模型的空白,我们基于预训练的字节对编码(BPE)分词器,在一个包含349GB数据(相当于900亿个token)的数据集上,对具有11亿、30亿和50亿参数的模型进行了单轮训练。MaLLaM有助于增强马来语的自然语言理解和生成任务。尽管仅在900亿token的较小数据集上训练,我们的指令微调版MaLLaM模型仍表现出竞争力。与ChatGPT3.5和Malaysian Mistral相比,MaLLaM的指令微调模型展示了显著的熟练度,突显了我们的方法在捕捉和理解马来西亚语言细微差别方面的有效性。MaLLaM模型标志着对该领域的重要贡献,提供了基于马来西亚语境的全面语言表征。这项工作旨在为增强特定于马来西亚语言细微差别的自然语言理解和生成任务铺平道路。我们讨论了训练方法、数据集组成,以及MaLLaM在马来语语境下提升大语言模型能力的潜在影响。所有模型发布于https://huggingface.co/collections/mesolitica/mallam-6577b59d1e0b436ae75f930f。

关键词

引用

@article{arxiv.2401.14680,
  title  = {MaLLaM -- Malaysia Large Language Model},
  author = {Husein Zolkepli and Aisyah Razak and Kamarul Adha and Ariff Nazhan},
  journal= {arXiv preprint arXiv:2401.14680},
  year   = {2024}
}