H2O-Danube3 技术报告
计算与语言
2024-07-15 v1 机器学习
摘要
我们介绍 H2O-Danube3,一系列小型语言模型,包括在 6T token 上训练的 H2O-Danube3-4B 以及在 4T token 上训练的 H2O-Danube3-500M。我们的模型是在由三阶段不同数据混合组成的高质量 Web 数据上预训练的,主要由英文 token 组成,然后进行最终的监督式调优以获得聊天版本。模型在大量学术、聊天和微调基准测试中表现出高度具竞争力的指标。由于其紧凑的架构,H2O-Danube3 可以在现代智能手机上高效运行,实现本地推理,即使在移动设备上也能实现快速处理。我们在 Apache 2.0 许可证下公开所有模型,进一步 democratizing 大型语言模型以面向更广泛的受众。
关键词
引用
@article{arxiv.2407.09276,
title = {H2O-Danube3 Technical Report},
author = {Pascal Pfeiffer and Philipp Singer and Yauhen Babakhin and Gabor Fodor and Nischay Dhankhar and Sri Satish Ambati},
journal= {arXiv preprint arXiv:2407.09276},
year = {2024}
}