中文

Sailor:面向东南亚语言的开放语言模型

计算与语言 2024-04-05 v1 人工智能

摘要

我们提出Sailor,一套规模从0.5B到7B参数的开放语言模型,专为东南亚(SEA)语言设计。这些模型基于Qwen1.5进行持续预训练,Qwen1.5是一种优秀的多语言用例语言模型。Sailor模型接受2000亿至4000亿个token,主要覆盖英文、中文、越南语、泰语、印尼语、马来语和老挼语等语言。训练利用了包括BPE dropout提高模型鲁棒性、激进的数据清洗与去重、以及小型代理模型优化数据混合等多项技术。实验结果表明,Sailor模型在四类典型任务上表现出色,包括常识推理、问答、阅读理解和考试等基准测试。秉持开源精神,我们通过本报告分享所见,以激发开发面向多语言用例的大型语言模型的更广泛兴趣。

关键词

引用

@article{arxiv.2404.03608,
  title  = {Sailor: Open Language Models for South-East Asia},
  author = {Longxu Dou and Qian Liu and Guangtao Zeng and Jia Guo and Jiahui Zhou and Wei Lu and Min Lin},
  journal= {arXiv preprint arXiv:2404.03608},
  year   = {2024}
}

备注

Code is available at https://github.com/sail-sg/sailor-llm