LiLiuM:eBay 的大型语言模型
计算与语言
2024-06-19 v1 机器学习
摘要
我们介绍 LiLiuM 系列大型语言模型(LLM):10 亿、70 亿和 130 亿参数模型,全部 100% 内部开发,以适应 eBay 在电商领域的具体需求。这使 eBay 对模型的所有方面都拥有完全控制权,包括许可证、数据、词汇表和架构。我们预计这些模型将用作微调和指令微调的基础,消除对外部模型的依赖。LiLiuM LLMs 是在 3 万亿 token 的多语言文本上训练的,涵盖通用和电商领域。它们在英文自然语言理解(NLU)基准测试中表现出与流行的 LLaMA-2 模型相似的性能。同时,我们在非英文 NLU 任务、机器翻译和电商特定下游任务上超越 LLaMA-2。作为我们数据混合的一部分,我们利用新发布的 RedPajama-V2 数据集进行训练,并分享我们关于数据筛选和去重的见解。我们还详细讨论了如何序列化结构化数据以用于自回归语言模型。我们提供在预训练中包括代码和平行机器翻译数据的影响。此外,我们发展了自己的分词器和模型词汇表,针对电商进行定制。这使我们能够在 eBay 特定的下游任务中实现最高可达 34% 的文本生成速度提升。最后,关于 LLM 预训练,我们显示,检查点平均化相对于最佳单个模型检查点可进一步提高性能。
引用
@article{arxiv.2406.12023,
title = {LiLiuM: eBay's Large Language Models for e-commerce},
author = {Christian Herold and Michael Kozielski and Leonid Ekimov and Pavel Petrushkov and Pierre-Yves Vandenbussche and Shahram Khadivi},
journal= {arXiv preprint arXiv:2406.12023},
year = {2024}
}