中文

为 isiXhosa构建BabyLMs: 低资源情境下的数据高效语言模型

计算与语言 2025-01-08 v1

摘要

BabyLM挑战呼吁参与者开发样本高效的语言模型。提交的模型在固定的英文语料上预训练,限制在儿童在发展中暴露于单词数量以下1亿。该挑战产生了新的数据高效语言模型架构,这些架构在训练超过千亿单词的模型方面表现更优。这为低资源语言提供了希望,因为这些语言的可用语料量远小于1亿单词。在本文中,我们以isiXhosa语言为案例研究,探索了BabyLMs的潜力。我们在isiXhosa语料上预训练了两种BabyLM架构,ELC-BERT和 MLSM。它们在词性标注和命名实体识别(NER)任务上均优于vanilla预训练模型,在后者方面实现显著提升(+3.2 F1分)。在某些情况下,BabyLMs甚至优于XLM-R。我们的发现表明,数据高效模型对低资源语言可行,但突显了高质量预训练数据的重要性与不足。最后,我们对BabyLM架构如何编码isiXhosa进行了可视化分析。

关键词

引用

@article{arxiv.2501.03855,
  title  = {BabyLMs for isiXhosa: Data-Efficient Language Modelling in a Low-Resource Context},
  author = {Alexis Matzopoulos and Charl Hendriks and Hishaam Mahomed and Francois Meyer},
  journal= {arXiv preprint arXiv:2501.03855},
  year   = {2025}
}