YAYI 2:多语言开源大语言模型
计算与语言
2023-12-25 v1 人工智能
摘要
作为自然语言处理的最新进展,大语言模型(LLM)在许多实际任务中已达到人类水平的语言理解与生成能力,甚至被视为通向通用人工智能的潜在路径。为了更好地促进 LLM 的研究,近期已提出许多开源 LLM(如 Llama 2 和 Falcon),并取得了与专有模型相当的性能。然而,这些模型主要针对英语场景设计,在中文语境下表现较差。在本技术报告中,我们提出了具有 300 亿参数的 YAYI 2,包括基础模型和对话模型。YAYI 2 在包含 2.65 万亿个 token 的多语言语料库上从头开始预训练,该语料库由我们的预训练数据处理流水线过滤。基础模型通过包含数百万指令的监督微调以及基于人类反馈的强化学习与人类价值观对齐。在 MMLU 和 CMMLU 等多个基准上的广泛实验一致表明,所提出的 YAYI 2 优于其他同等规模的开源模型。
引用
@article{arxiv.2312.14862,
title = {YAYI 2: Multilingual Open-Source Large Language Models},
author = {Yin Luo and Qingchao Kong and Nan Xu and Jia Cao and Bao Hao and Baoyu Qu and Bo Chen and Chao Zhu and Chenyang Zhao and Donglei Zhang and Fan Feng and Feifei Zhao and Hailong Sun and Hanxuan Yang and Haojun Pan and Hongyu Liu and Jianbin Guo and Jiangtao Du and Jingyi Wang and Junfeng Li and Lei Sun and Liduo Liu and Lifeng Dong and Lili Liu and Lin Wang and Liwen Zhang and Minzheng Wang and Pin Wang and Ping Yu and Qingxiao Li and Rui Yan and Rui Zou and Ruiqun Li and Taiwen Huang and Xiaodong Wang and Xiaofei Wu and Xin Peng and Xina Zhang and Xing Fang and Xinglin Xiao and Yanni Hao and Yao Dong and Yigang Wang and Ying Liu and Yongyu Jiang and Yungan Wang and Yuqi Wang and Zhangsheng Wang and Zhaoxin Yu and Zhen Luo and Wenji Mao and Lei Wang and Dajun Zeng},
journal= {arXiv preprint arXiv:2312.14862},
year = {2023}
}