中文

TharuChat:通过合成数据与人类验证为低资源语言启动大语言模型

计算与语言 2026-03-19 v1 人工智能 机器学习

摘要

大语言模型的快速扩散加剧了数字鸿沟,实际上将全球南方地区的本土语言排除在 AI 革命之外。Tharu 语言是一种印度-阿拉伯语族的口语方言,约有 170 万使用者分布在 nepal 与印度的 Terai 带,尽管拥有丰富的口头传统,但因数据稀缺与语言碎片化而受限,导致当前多语言模型常“幻觉”或退回至印度-阿拉伯语族的高资源邻近语言如印地语和尼泊尔语。本文提出 Tharu-LLaMA(3B),一种针对该语言的专业指令跟随模型。我们引入 TharuChat,一个通过 LLM-to-Human 引导管道构建的新型数据集。我们利用 prompt-engineered 的 Gemini 模型,结合 Rana Tharu 语法与民间故事,合成训练数据。不同于精心挑选的黄金标准语料,TharuChat 反映了该地区嘈杂、异构的语言现实:以 Rana Tharu 为主(约占 70%),同时融合 Dangaura 与 Kochila 方言元素。我们提供数据集局限性的透明分析,包括方言混合代码及残留阿瓦达希/印地语的影响。通过严格的经验消融研究,我们证明尽管存在这些缺陷,小规模合成数据仍高度有效:数据量从 25% 提升至 100% 时,困惑度线性下降,从 6.42 降至 2.88。最终得到的模型是面向保存全球 Himalayan 语言的一种概念证明,能够在消费级硬件上实现。

关键词

引用

@article{arxiv.2603.17220,
  title  = {TharuChat: Bootstrapping Large Language Models for a Low-Resource Language via Synthetic Data and Human Validation},
  author = {Prajwal Panth and Agniva Maiti},
  journal= {arXiv preprint arXiv:2603.17220},
  year   = {2026}
}

备注

6 pages, 1 figure, 2 tables. Preprint. Code and dataset available on Hugging Face