OpenELM:高效语言模型家族及开放训练与推理框架
计算与语言
2024-05-03 v2 人工智能
机器学习
摘要
大型语言模型的可重复性和透明度对于推进开放研究、确保结果可信、以及探讨数据和模型偏见及潜在风险至关重要。为此,我们发布了 OpenELM——一个最先进的开放语言模型。OpenELM 采用层级缩放策略,在 transformer 模型的每一层中高效分配参数,从而提升准确率。例如,在约一百万参数的预算下,OpenELM 相较于 OLMo 在准确率上提升 2.36%,且仅需预训练标记数为 OLMo 的 1/2。与以往仅提供模型权重、推理代码,以及基于私有数据集进行预训练的做法不同,我们的发布包括完整的语言模型训练与评估框架,使用公开数据集进行训练,包括训练日志、多个检查点以及预训练配置。我们还发布了将模型转换为 MLX 库以便在 Apple 设备上进行推理和微调的代码。该全面发布旨在赋能并强化开放研究社区,为未来的开放研究 endeavour 铺平道路。我们的源代码、预训练模型权重和训练配方已在 \url{https://github.com/apple/corenet} 提供。此外,\model 模型可在 HuggingFace 上找到:\url{https://huggingface.co/apple/OpenELM}。
引用
@article{arxiv.2404.14619,
title = {OpenELM: An Efficient Language Model Family with Open Training and Inference Framework},
author = {Sachin Mehta and Mohammad Hossein Sekhavat and Qingqing Cao and Maxwell Horton and Yanzi Jin and Chenfan Sun and Iman Mirzadeh and Mahyar Najibi and Dmitry Belenko and Peter Zatloukal and Mohammad Rastegari},
journal= {arXiv preprint arXiv:2404.14619},
year = {2024}
}
备注
Minor corrections