中文

Yi:由 01.AI 开发的开源基础模型

计算与语言 2025-01-22 v3 人工智能

摘要

我们介绍了 Yi 模型系列,这是一系列展现出强大多维能力的语言与多模态模型。Yi 模型系列基于 6B 和 34B 预训练语言模型,随后我们将其扩展为对话模型、200K 长上下文模型、深度扩展模型以及视觉-语言模型。我们的基础模型在 MMLU 等众多基准测试上取得了强劲表现,而微调后的对话模型在 AlpacaEval 和 Chatbot Arena 等主要评测平台上展现出高人类偏好率。基于我们可扩展的超级计算基础设施和经典的 Transformer 架构,我们将 Yi 模型的性能主要归功于数据工程努力带来的数据质量。在预训练阶段,我们使用级联数据去重和质量过滤流水线构建了包含 3.1 万亿 token 的英文和中文语料库。在微调阶段,我们通过多次迭代打磨了一个小规模(少于 10K)的指令数据集,使得每一个实例都由我们的机器学习工程师直接验证。在视觉-语言方面,我们将对话语言模型与视觉 Transformer 编码器相结合,并训练模型以将视觉表示对齐到语言模型的语义空间中。我们通过轻量级持续预训练进一步将上下文长度扩展至 200K,并展示了强大的大海捞针式检索性能。我们表明,通过持续预训练扩展预训练检查点的深度可以进一步提升性能。我们相信,鉴于当前的结果,使用经过彻底优化的数据继续扩大模型参数规模,将带来更强大的前沿模型。

关键词

引用

@article{arxiv.2403.04652,
  title  = {Yi: Open Foundation Models by 01.AI},
  author = {01. AI and : and Alex Young and Bei Chen and Chao Li and Chengen Huang and Ge Zhang and Guanwei Zhang and Guoyin Wang and Heng Li and Jiangcheng Zhu and Jianqun Chen and Jing Chang and Kaidong Yu and Peng Liu and Qiang Liu and Shawn Yue and Senbin Yang and Shiming Yang and Wen Xie and Wenhao Huang and Xiaohui Hu and Xiaoyi Ren and Xinyao Niu and Pengcheng Nie and Yanpeng Li and Yuchi Xu and Yudong Liu and Yue Wang and Yuxuan Cai and Zhenyu Gu and Zhiyuan Liu and Zonghong Dai},
  journal= {arXiv preprint arXiv:2403.04652},
  year   = {2025}
}