中文

面向低资源语言处理与大规模建模的结构化藏语基础数据集

计算与语言 2026-05-27 v7

摘要

大型语言模型(LLM)在高资源语言上取得了显著成果,但藏语领域的进展严重受限。虽然近期努力开始解决藏语预训练数据稀缺的问题,但仍存在更根本的缺口:目前没有资源支持完整的LLM开发流程,涵盖预训练、指令调优、安全对齐、偏好优化和推理监督等各关键阶段。我们引入藏语基础数据集(TFD),这是第一个结构化、大规模且由专家精选的覆盖藏语大语言模型所有关键阶段的数据集。TFD包含TIBSTC,即超过110亿token的统一语料库,包含针对指令调优、安全对齐和偏好优化的精选子数据集,以及TIBSTC-CoT——首个大规模藏语链式思维数据集。我们通过训练Sun-Shine系列藏语LLM,展示了其在理解、安全、推理和生成基准测试上的显著提升。这些结果表明,低资源语言建模不仅需要规模,还需要完整结构化的数据生态系统。我们发布TFD以促进可重复研究和开发健壮且文化导向的藏语LLM。代码和数据已发布于https://github.com/Vicentvankor/sun-shine。

关键词

引用

@article{arxiv.2503.18288,
  title  = {TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling},
  author = {Cheng Huang and Fan Gao and Nyima Tashi and Yutong Liu and Yadi Liu and Wenbin Wei and Xiangxiang Wang and Yongbin Yu},
  journal= {arXiv preprint arXiv:2503.18288},
  year   = {2026}
}