Xmodel-1.5:一个 10 亿参数规模的多语言大语言模型
计算与语言
2024-12-05 v3
摘要
我们推出 Xmodel-1.5,一个在 2 万亿 token 上预训练的 10 亿参数多语言大语言模型,旨在实现平衡的性能和可扩展性。与大多数使用 BPE 分词器的大模型不同,Xmodel-1.5 采用包含 65,280 个 token 的自定义 unigram 分词器,优化了效率和准确性。该模型在泰语、阿拉伯语、法语、中文和英文等多种语言上表现出有竞争力的结果,在相应评估数据集上超越了阿里巴巴的 PolyLM-1.7B。Xmodel-1.5 在 mMMLU 和 PIQA 等基准测试中表现优异,并在泰语上达到最先进水平。为支持低资源语言研究,我们发布了 Xdata_Thai,一个包含性别助词和成语等独特语言挑战的泰语专用评估数据集。虽然模型展示了强劲性能,但在处理文化特定细微差别方面仍有改进空间。我们希望这项工作为多语言 AI 研究的进步做出贡献。模型和代码已在 GitHub 上公开:https://github.com/XiaoduoAILab/XmodelLM-1.5
引用
@article{arxiv.2411.10083,
title = {Xmodel-1.5: An 1B-scale Multilingual LLM},
author = {Wang Qun and Liu Yang and Lin Qingquan and Jiang Ling},
journal= {arXiv preprint arXiv:2411.10083},
year = {2024}
}