中文

TIBSTC-CoT:面向语言模型思维链推理的多领域指令数据集

计算与语言 2025-12-17 v2 人工智能

摘要

为了解决藏语(一种由超过六百万人使用的低资源语言)严重的数据稀缺问题,我们引入了 TIBSTC-CoT,这是一个通过大型语言模型(LLMs)的思维链提示自动构建的大规模、多领域藏语数据集。TIBSTC-CoT 为低资源环境下的数据集创建建立了一个可扩展且可复现的框架,涵盖了语言理解与生成所必需的多样化领域和推理模式。在此数据集的基础上,我们开发了 Sunshine-thinking LLM 系列,这是一系列具备思维链能力的以藏语为中心的 LLM。Sunshine-thinking 完全在 TIBSTC-CoT 上训练,展现出强大的推理与生成性能,可与最先进(SOTA)的多语言 LLM 相媲美。我们的工作通过资源创建和模型创新,实现了高质量的藏语处理,标志着迈向包容性 AI 的重要一步。所有数据可在以下网址获取:https://github.com/Vicentvankor/sun-shine。

关键词

引用

@article{arxiv.2508.01977,
  title  = {TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models},
  author = {Fan Gao and Cheng Huang and Nyima Tashi and Yutong Liu and Xiangxiang Wang and Thupten Tsering and Ban Ma-bao and Renzeg Duojie and Gadeng Luosang and Rinchen Dongrub and Dorje Tashi and Xiao Feng and Hao Wang and Yongbin Yu},
  journal= {arXiv preprint arXiv:2508.01977},
  year   = {2025}
}

备注

We will merge this paper with arXiv:2503.18288