中文

Aquila2 技术报告

计算与语言 2024-08-15 v1

摘要

本文介绍了 Aquila2 系列,该系列包含参数规模为 70 亿、340 亿和 700 亿的双语模型。这些模型基于一种名为 HeuriMentor (HM) 的创新框架进行训练,该框架提供模型收敛的实时洞察并增强训练过程和数据管理。HM 系统由自适应训练引擎 (ATE)、训练状态监控器 (TSM) 和数据管理单元 (DMU) 组成,能够精确监控模型训练进度并实现数据分布的高效优化,从而提升训练效果。广泛的评估表明,Aquila2 模型系列在英语和中文基准测试上表现相当。Aquila2-34B 在量化至 Int4 时仅表现出轻微的性能下降。此外,我们已公开训练代码 (https://github.com/FlagOpen/FlagScale) 和模型权重 (https://github.com/FlagAI-Open/Aquila2),以支持持续研究和应用开发。

关键词

引用

@article{arxiv.2408.07410,
  title  = {Aquila2 Technical Report},
  author = {Bo-Wen Zhang and Liangdong Wang and Jijie Li and Shuhao Gu and Xinya Wu and Zhengduo Zhang and Boyan Gao and Yulong Ao and Guang Liu},
  journal= {arXiv preprint arXiv:2408.07410},
  year   = {2024}
}