面向低资源语言处理与大规模建模的结构化藏语基础数据集
计算与语言
2026-05-27 v7
摘要
大型语言模型(LLM)在高资源语言上取得了显著成果,但藏语领域的进展严重受限。虽然近期努力开始解决藏语预训练数据稀缺的问题,但仍存在更根本的缺口:目前没有资源支持完整的LLM开发流程,涵盖预训练、指令调优、安全对齐、偏好优化和推理监督等各关键阶段。我们引入藏语基础数据集(TFD),这是第一个结构化、大规模且由专家精选的覆盖藏语大语言模型所有关键阶段的数据集。TFD包含TIBSTC,即超过110亿token的统一语料库,包含针对指令调优、安全对齐和偏好优化的精选子数据集,以及TIBSTC-CoT——首个大规模藏语链式思维数据集。我们通过训练Sun-Shine系列藏语LLM,展示了其在理解、安全、推理和生成基准测试上的显著提升。这些结果表明,低资源语言建模不仅需要规模,还需要完整结构化的数据生态系统。我们发布TFD以促进可重复研究和开发健壮且文化导向的藏语LLM。代码和数据已发布于https://github.com/Vicentvankor/sun-shine。
引用
@article{arxiv.2503.18288,
title = {TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling},
author = {Cheng Huang and Fan Gao and Nyima Tashi and Yutong Liu and Yadi Liu and Wenbin Wei and Xiangxiang Wang and Yongbin Yu},
journal= {arXiv preprint arXiv:2503.18288},
year = {2026}
}