MobiLlama: 面向准确且轻量级的全透明 GPT
计算与语言
2024-02-27 v1
摘要
“大即是好”是近期大型语言模型(LLM)开发中的主要趋势。然而,LLM 在需要设备内处理、能源效率、低内存占用和响应效率的场景下表现不佳。这些要求对于隐私、安全和可持续部署至关重要。本文通过应对设计适用于资源受限设备的准确且高效小型语言模型(SLM)的挑战,探索“少即是多”的范式。我们的主要贡献是引入一个准确且完全透明的开源 0.5 亿参数(0.5B)小型语言模型,命名为 MobiLlama,旨在强化性能的同时降低资源需求。MobiLlama 是一种从更大模型开始并应用精心设计的参数共享方案,以减少预训练和部署成本的 SLM 设计。我们的工作不仅旨在弥合开源 SLM 之间的差距,还确保完全透明性,其中完整的训练数据管道、训练代码、模型权重、超过 300 个检查点以及评估代码均可在 https://github.com/mbzuai-oryx/MobiLlama 提供。
引用
@article{arxiv.2402.16840,
title = {MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT},
author = {Omkar Thawakar and Ashmal Vayani and Salman Khan and Hisham Cholakal and Rao M. Anwer and Michael Felsberg and Tim Baldwin and Eric P. Xing and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2402.16840},
year = {2024}
}
备注
Code available at : https://github.com/mbzuai-oryx/MobiLlama