MAP-Neo:高性能且透明的双语大语言模型系列
计算与语言
2024-07-11 v4 人工智能
机器学习
摘要
近年来,大语言模型(LLM)取得了巨大进步,在不同任务上实现了前所未有的性能。然而,由于商业利益,GPT、Gemini和Claude等最具竞争力的模型被封闭在专有接口之后,未公开训练细节。最近,许多机构开源了若干强大的LLM(如LLaMA-3),其性能可与现有闭源LLM媲美。然而,仅提供了模型权重,大部分细节(如中间检查点、预训练语料库和训练代码等)未公开。为提高LLM的透明度,研究社区已形成开源真正开放LLM(如Pythia、Amber、OLMo)的趋势,这些模型提供了更多细节(如预训练语料库和训练代码)。这些模型极大地推进了对这些大型模型(包括其优势、弱点、偏见和风险)的科学研究。然而,我们观察到,现有真正开放的LLM在推理、知识和编码任务上仍逊于具有相似模型尺寸的现有最先进LLM。为此,我们开源了MAP-Neo,一个高性能且透明的双语语言模型,拥有7B参数,从头开始在4.5T高质量词元上训练。我们的MAP-Neo是首个完全开源的双语LLM,性能与现有最先进LLM相当。此外,我们开源了复现MAP-Neo的所有细节,包括清洗后的预训练语料库、数据清洗流程、检查点以及经过充分优化的训练/评估框架。最后,我们希望MAP-Neo能够增强和壮大开放研究社区,激发更多创新和创造力,以促进LLM的进一步发展。
引用
@article{arxiv.2405.19327,
title = {MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series},
author = {Ge Zhang and Scott Qu and Jiaheng Liu and Chenchen Zhang and Chenghua Lin and Chou Leuang Yu and Danny Pan and Esther Cheng and Jie Liu and Qunshu Lin and Raven Yuan and Tuney Zheng and Wei Pang and Xinrun Du and Yiming Liang and Yinghao Ma and Yizhi Li and Ziyang Ma and Bill Lin and Emmanouil Benetos and Huan Yang and Junting Zhou and Kaijing Ma and Minghao Liu and Morry Niu and Noah Wang and Quehry Que and Ruibo Liu and Sine Liu and Shawn Guo and Soren Gao and Wangchunshu Zhou and Xinyue Zhang and Yizhi Zhou and Yubo Wang and Yuelin Bai and Yuhan Zhang and Yuxiang Zhang and Zenith Wang and Zhenzhu Yang and Zijian Zhao and Jiajun Zhang and Wanli Ouyang and Wenhao Huang and Wenhu Chen},
journal= {arXiv preprint arXiv:2405.19327},
year = {2024}
}
备注
https://map-neo.github.io/