中文

基于Mistral的大规模马来西亚语言模型以增强本地语言理解

计算与语言 2024-02-06 v3

摘要

在本文中,我们展示了使用32.6 GB数据集(相当于11亿个token)对大规模语言模型Mistral 7B进行预训练所取得的显著进展。我们探索了扩展上下文长度的影响,发布了上下文长度分别为4096和32768个token的模型,并通过一个专门的16384上下文长度指令微调模型(我们称之为Malaysian Mistral)进一步优化了性能。我们的实验证明了继续预训练的有效性以及扩展上下文长度对Mistral 7B语言理解能力的影响。此外,我们发布了一个专门用16384上下文长度指令进行微调的模型,展示了其捕捉细微语言复杂性的潜力。更进一步,我们的研究为Malaysian Mistral与包括ChatGPT3.5和Claude 2在内的知名语言模型的基准测试做出了贡献。我们呈现了令人信服的结果,表明Malaysian Mistral在Tatabahasa(马来语语法)测试集上表现优越,尤其是在经过指令微调后。所有模型均在https://huggingface.co/collections/mesolitica/malaysian-mistral-7b-6528f2ec825f4bba46c1700c发布。

关键词

引用

@article{arxiv.2401.13565,
  title  = {Large Malaysian Language Model Based on Mistral for Enhanced Local Language Understanding},
  author = {Husein Zolkepli and Aisyah Razak and Kamarul Adha and Ariff Nazhan},
  journal= {arXiv preprint arXiv:2401.13565},
  year   = {2024}
}