中文

面向超低资源语言的多语言语言模型有效词汇扩展

计算与语言 2026-02-11 v1

摘要

多语言预训练语言模型(mPLMs)为许多低资源语言提供了显著的益处。为进一步扩展这些模型支持的语言范围,许多研究聚焦于对这些模型进行 continued pre-training。然而,鲜有研究关注如何扩展 mPLMs 以支持此前不受支持的低资源语言。为解决此问题,我们通过目标语言语料扩展模型词汇。随后,我们从模型原始词汇中筛选出一个子集,该子集对代表源语言(如英语)的偏差表示具有偏向性,并利用双语词典初始化扩展词汇的表示。随后,基于这些扩展词汇的表示,我们使用目标语言语料对 mPLMs 进行 continued pre-training。实验结果表明,我们提出的方法优于基线方法——后者使用随机初始化的扩展词汇进行 continued pre-training。在词性标注和命名实体识别任务中,分别实现了 0.54% 和 2.60% 的提升。此外,我们的方法在选择训练语料方面表现出高鲁棒性,continued pre-training 后模型在源语言上的性能未下降。

关键词

引用

@article{arxiv.2602.09388,
  title  = {Effective vocabulary expanding of multilingual language models for extremely low-resource languages},
  author = {Jianyu Zheng},
  journal= {arXiv preprint arXiv:2602.09388},
  year   = {2026}
}

备注

12 pages, 5 figures, 7 tables, under review