中文

SeaLLMs——面向东南亚的大语言模型

计算与语言 2024-07-02 v2

摘要

尽管大语言模型(LLMs)在各种任务中取得了显著成就,但仍然存在有利于高资源语言(如英语)而往往以低资源和区域语言为代价的语言偏见。为应对这种不平衡,我们引入了SeaLLMs,一系列专门关注东南亚(SEA)语言的创新语言模型。SeaLLMs构建于Llama-2模型之上,并通过扩展词表的持续预训练、专门的指令与对齐微调进一步优化,以更好地捕捉区域语言的精微之处。这使得它们能够尊重并反映当地文化规范、习俗、风格偏好和法律考量。我们的综合评估表明,相对于可比的开源模型,SeaLLM-13b模型在广泛的语言任务和以助手风格跟随指令的能力上表现出优越性能。此外,在泰语、高棉语、老挝语和缅甸语等非拉丁语言上,它们以较大幅度优于ChatGPT-3.5,同时保持轻量且具成本效益。

关键词

引用

@article{arxiv.2312.00738,
  title  = {SeaLLMs -- Large Language Models for Southeast Asia},
  author = {Xuan-Phi Nguyen and Wenxuan Zhang and Xin Li and Mahani Aljunied and Zhiqiang Hu and Chenhui Shen and Yew Ken Chia and Xingxuan Li and Jianyu Wang and Qingyu Tan and Liying Cheng and Guanzheng Chen and Yue Deng and Sen Yang and Chaoqun Liu and Hang Zhang and Lidong Bing},
  journal= {arXiv preprint arXiv:2312.00738},
  year   = {2024}
}

备注

Technical report, ACL 2024 DEMO TRACK