从精选数据到可扩展模型:为藏语构建持续预训练的稠密模型和Mixture-of-Experts大语言模型
计算与语言
2026-05-14 v5
摘要
大型语言模型(LLM)在广泛的自然语言处理任务中取得了显著的成功,但其性能严重偏向于高资源语言。藏语虽然具有文化重要性和庞大的使用者群群体,却严重缺乏代表性。本工作提出了一套全面的管道,用于通过大规模数据整理和持续预训练来推动藏语语言建模。我们构建了72 GB的高质量藏语语料库,目前规模最大,并通过藏语、中文和英语的平衡多语言持续预训练来适配Qwen2.5-7B,随后进行多语言指令调优。为进一步高效扩展容量,我们将稠密模型扩展为50B-A10B Mixture-of-Experts架构。由于缺乏标准化的藏语基准, 我们通过高质量翻译和人工验证构建了多个评估数据集。实验结果表明,稠密模型和MoE模型在 diverse 任务上均 consistently 优于规模相似的现有开源模型和藏语专注模型。我们的工作推动了藏语中心的LLM研究,为扩展其他低资源语言的LLM提供了可迁移的见解。我们将在后续工作中发布模型权重、评估基准以及详细的数据处理文档。
引用
@article{arxiv.2507.09205,
title = {From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan},
author = {Lei Yang and Leiyu Pan and Bojian Xiong and Renren Jin and Shaowei Zhang and Yue Chen and Ling Shi and Jiang Zhou and Junru Wu and Zhen Wang and Jianxiang Peng and Juesi Xiao and Tianyu Dong and Zhuowen Han and Zhuo Chen and Yuqi Ren and Deyi Xiong},
journal= {arXiv preprint arXiv:2507.09205},
year = {2026}
}