中文

UrduLM:面向资源受限环境的阿鲁德语单语语言模型

计算与语言 2026-01-27 v1 人工智能

摘要

阿鲁德语全球约有 2.3 亿使用者,缺乏专门的基于变换器的语言模型和精选语料库。虽然多语言模型提供有限的阿鲁德语支持,但因训练数据不足,性能差异大、计算成本高、文化不准确。为此,我们提出 UrduLM,一个在资源受限环境下训练的阿鲁德语单语语言模型。我们策划了来自多源的 33GB 阿鲁德语语料库,开发自定义 BPE 分词器,使分词开销至少降低 20-30%,并预训练一个 100M 参数的解码器模型。在 few-shot 评估中,UrduLM 性能与规模最多可达其 30 倍的多语言模型相当,在情感分类中达到 66.6% 准确率,在语法纠错任务中 BLEU 分数超过 30。完整的 methodology——包括语料库、分词器、模型权重和评估基准——已开源发布,以建立阿鲁德语 NLP 研究的基准,并为其他资源不足语言提供可扩展框架。

关键词

引用

@article{arxiv.2601.17664,
  title  = {UrduLM: A Resource-Efficient Monolingual Urdu Language Model},
  author = {Syed Muhammad Ali and Hammad Sajid and Zainab Haider and Ali Muhammad Asad and Haya Fatima and Abdul Samad},
  journal= {arXiv preprint arXiv:2601.17664},
  year   = {2026}
}

备注

12 pages