Xmodel-2 技术报告
人工智能
2024-12-30 v1
摘要
Xmodel-2 是一个专为推理任务设计的 12 亿参数大型语言模型。其架构使不同模型规模能够共享一套统一的超参数,从而允许在较小模型上进行大量实验,并将最佳配置无缝迁移到更大模型。为最大化训练效率和稳定性,Xmodel-2 采用 MiniCPM 的 WSD 学习率调度器。该模型在来自多样来源的 1.5 万亿 token 预训练,实现了在复杂推理和基于智能体任务中的状态最佳性能,同时保持低训练成本。这些结果凸显了高效模型设计和训练策略在推进推理能力方面的潜力。模型检查点和代码已在 GitHub 公开 availability at https://github.com/XiaoduoAILab/Xmodel-2
引用
@article{arxiv.2412.19638,
title = {Xmodel-2 Technical Report},
author = {Wang Qun and Liu Yang and Lin Qingquan and Qu Zhijiu and Jiang Ling},
journal= {arXiv preprint arXiv:2412.19638},
year = {2024}
}